文章摘要
该仓库提供Qwen3.8模型权重与配置文件,兼容多种推理框架。Qwen3.8是开源系列最强版本,首次开放Max级模型,在编程、专业工作、研究及长程智能体任务上显著提升,具备更强的自主规划与执行能力。
文章总结
本仓库提供了基于Hugging Face Transformers格式的后训练模型权重与配置文件,这些资源兼容vLLM、SGLang、TokenSpeed等推理框架。对于需要托管式、可扩展推理服务且无需自行维护基础设施的用户,官方Qwen API服务由Qwen Cloud提供。其中,Qwen3.8-Max是基于Qwen3.8-2.4T-A95B的官方版本,具备视觉输入与非思考模式支持、默认100万上下文长度、内置官方工具等更多功能。更多信息请参考Qwen3.8-Max概述。
在Qwen3.5和Qwen3.6系列获得广泛社区采用后,我们很高兴推出Qwen3.8,这是Qwen开源模型家族中迄今为止能力最强的版本。Qwen3.8首次将Qwen-Max级别的模型开源发布。基于Qwen3.5的架构基础,Qwen3.8在编程、专业工作、研究和长期智能体任务方面取得了显著提升。除了能回答更困难的问题,Qwen3.8还旨在以更高的可靠性完成复杂、多步骤的任务。
Qwen3.8亮点包括:核心能力全面提升,涵盖编程、专业工作、研究和长期智能体任务;智能体执行方面,具备更强的自主规划和环境反馈处理能力,实现更可靠的端到端任务完成;下游兼容性更广,支持更多主流工具和开发框架,便于集成到现有技术栈;灵活的思考控制,可通过reasoning_effort调节推理深度,并通过preserve_thinking保留历史消息中的推理上下文。
模型概述:类型为因果语言模型,训练阶段包括预训练和后训练。语言模型总参数量2.4T,激活参数95B,隐藏维度8192,词嵌入维度248,320(填充后),层数92层,隐藏层布局为23×(3×(门控DeltaNet→MoE)→1×(门控注意力→MoE))。门控DeltaNet的线性注意力头数为128(V)和16(QK),头维度128;门控注意力的注意力头数为64(Q)和4(KV),头维度256,旋转位置嵌入维度64。混合专家模型有512个专家,其中10个路由专家和1个共享专家被激活,中间维度2048。LM输出维度248,320(填充后),支持多步令牌预测。上下文长度原生为262,144个令牌,可扩展至1,010,000个令牌。
基准测试结果展示了Qwen3.8-Max在多个编码、智能体和通用能力基准上的表现,与Opus 4.8、Fable 5、GPT-5.6 Sol和Qwen3.7-Max等模型进行了对比。具体分数详见表格。
快速入门方面,建议通过API使用Qwen3.8。推理效率和吞吐量因框架而异,推荐使用最新版本的SGLang、vLLM或TokenSpeed等专用推理引擎。Qwen3.8-2.4T-A95B是纯文本模型,所有交互都需要思考模式,不支持多模态输入,且思考模式无法禁用。每个响应会自动以<thinking>标签内的推理内容开始,随后输出最终答案。建议使用以下采样参数:temperature=1.0、top_p=0.95、top_k=20、min_p=0.0、presence_penalty=0.0、repetition_penalty=1.0。Qwen3.8官方支持reasoning_effort参数,可调节推理深度:xhigh(默认,适用于复杂任务)、medium(平衡准确性与速度)、low(高效推理,优化速度与成本)。此外,preserve_thinking默认启用,以提供最佳开箱即用体验。
最佳实践建议:使用推荐的采样参数;对于支持的框架,可将presence_penalty参数调整至0到2以减少重复,但较高值可能导致语言混合和性能轻微下降;为优化智能体任务性能,建议分配足够的输出长度,在100万上下文长度内,推理内容最大输出长度设为262,144个令牌,最终响应最大输出长度设为131,072个令牌。
如需引用,请参考相关文献。
评论总结
根据评论内容,总结如下:
主要观点与论据:
模型规模与性能:评论普遍认为Qwen3.8-Max是迄今为止参数最大的开源模型(BF16约4.9TB,FP8约2.4TB),性能接近或超越Opus 4.5/4.8和Fable 5级别。关键引用:
- "The full lossless model BF16 is clocking at 4.9TB... between Opus 4.8 and Fable 5" (guardiangod)
- "Is this the largest ever open weight model release by parameter count? I think it is." (simonw)
量化与部署挑战:模型仅提供BF16和FP8版本,缺乏QAT支持,导致部署门槛高。1bit量化版约397GB,但需7TB RAM才能运行完整模型。关键引用:
- "No QAT on q4 means that someone with deep pockets... will have to quant it" (NitpickLawyer)
- "The 1bit quant model is at an astonishing 397GB... still within the realm of medium size companies" (guardiangod)
功能限制:开源版移除了视觉能力,上下文长度限制为250k(官方版为1M),且缺乏DSpark/DFlash支持。关键引用:
- "the open source version has its vision capability removed, and the context capped at 250k" (guardiangod)
- "That is unfortunate, that the open weight model doesn't have vision support or the 1M context length" (l72)
许可证与商业限制:许可证类似Kimi k3,年收入低于5000万美元可免费使用,超过此限制需付费。关键引用:
- "Free to use for internal or <50M$ revenue / year. Limitations above that threshold" (NitpickLawyer)
本地运行可行性:多数评论者认为模型过大无法本地运行(如RTX 5090+64GB RAM),期待更小的27B版本。关键引用:
- "More curious about how qwen3.8-27B performs. That's the size that I can run locally." (ByteWarden)
- "I get the impression that models like Qwen and Kimi k3 are impossible to run locally" (cautiouscat)
平衡性说明: 评论整体对模型性能持积极态度,但普遍指出部署门槛高、功能受限等现实问题。部分评论者关注即将发布的27B版本,认为其对本地用户更具吸引力。