文章摘要
该仓库提供了FP8量化模型权重和配置文件,兼容多种框架,性能与原模型几乎一致。Qwen3.8-27B是Qwen开源系列的最新模型,基于Qwen3.5架构,在编程、专业工作、研究和长程任务上显著提升,支持图像视频理解与灵活思维控制。
文章总结
本仓库包含FP8量化后的模型权重和配置文件,这些文件采用Hugging Face Transformers格式,并兼容Hugging Face Transformers、vLLM、SGLang、TokenSpeed等框架。量化方法为细粒度FP8量化,块大小为128,其性能指标与原模型几乎一致。
对于希望获得托管式、可扩展推理服务且无需维护基础设施的用户,官方Qwen API服务由Qwen Cloud提供。特别是,Qwen3.8-27B将作为托管版本提供,并具备更多生产级功能,例如默认支持100万上下文长度和官方内置工具。更多信息请参考Qwen3.8-27B概述。该服务即将推出,敬请关注。
在Qwen3.5和Qwen3.6系列获得社区广泛采用后,我们很高兴推出Qwen3.8,这是Qwen开源模型家族中迄今为止能力最强的版本。
基于Qwen3.5的架构基础,Qwen3.8在编码、专业工作、研究和长期智能体任务方面取得了显著提升。Qwen3.8-27B将这些进步融入了一个紧凑、易于部署的密集模型中:一个原生视觉语言模型,能够理解图像和视频,具备灵活的思维控制,旨在更可靠地完成复杂、多步骤的任务。
Qwen3.8亮点
Qwen3.8-27B具备以下增强功能:
- 核心能力:在编码、专业工作、研究和长期智能体任务方面实现全面改进。
- 智能体执行:更强的自主规划能力和对环境反馈的更好处理,从而实现更可靠的端到端任务完成。
- 下游兼容性:更广泛地支持流行的测试框架和开发工具,使其更易于集成到现有技术栈中。
- 灵活的思维控制:思维模式默认开启,可根据请求禁用;推理深度可通过
reasoning_effort调整;历史消息中的推理上下文通过preserve_thinking保留。 - 视觉语言理解:原生支持图像和视频理解,涵盖从STEM图表、文档到时长数小时的视频。
模型概述
- 类型:带视觉编码器的因果语言模型
- 训练阶段:预训练与后训练
- 语言模型参数:270亿
- 隐藏层维度:5120
- 词嵌入维度:248,320(已填充)
- 层数:64
- 隐藏层布局:16 × (3 × (门控DeltaNet → 前馈网络) → 1 × (门控注意力 → 前馈网络))
- 门控DeltaNet:线性注意力头数:V为48,QK为16;头维度:128
- 门控注意力:注意力头数:Q为24,KV为4;头维度:256
- 旋转位置嵌入维度:64
- 前馈网络:中间维度:17,408
- 语言模型输出维度:248,320(已填充)
- 多令牌预测:经过多步训练
- 上下文长度:原生支持262,144个令牌,可扩展至1,000,000个令牌。
基准测试结果
在文本性能方面,Qwen3.8-27B在多项基准测试中均优于Qwen3.6-27B和Qwen3.7-Plus等模型,特别是在智能体编码、软件工程和长期办公任务等场景中表现突出。在视觉语言性能方面,Qwen3.8-27B在智能体多模态任务、通用多模态智能和文档智能等测试中也取得了领先成绩。
快速开始
为简化集成,建议通过API使用Qwen3.8。
部署Qwen3.8
推理效率和吞吐量在不同框架间差异显著。建议使用最新版本的框架以确保最佳性能和兼容性。对于生产工作负载或高吞吐量场景,推荐使用SGLang、vLLM或TokenSpeed等专用服务引擎。
API使用
Qwen3.8模型默认以思维模式运行,在生成最终回复前会输出思维内容。要禁用思维内容并获得直接回复,请参考相关示例。
建议使用以下采样参数集进行生成:
* 思维模式:temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
* 指令(或非思维)模式:temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0
请注意,不同推理框架对采样参数的支持情况可能有所不同。
Qwen3.8官方支持reasoning_effort参数,可用于调整推理深度和控制成本:
* xhigh(默认):适用于需要深入分析的复杂任务
* medium:平衡准确性和速度
* low:高效推理,优化速度和成本
此外,preserve_thinking默认对所有工作负载启用,以提供最佳的开箱即用体验。要禁用保留思维功能,请参考相关示例。
在多轮智能体任务中,较低的推理努力并不总能减少总体任务完成时间。虽然它可能产生更快的单轮响应,但也可能导致分析不足、更多失败和重复重试,从而增加总延迟和令牌消耗。
聊天补全API
聊天补全API可与大多数推理框架以及Qwen Cloud一起使用。开始前,请确保已安装OpenAI Python SDK,并配置了API密钥和API基础URL。
最佳实践
为获得最佳性能,建议采用以下设置:
- 采样参数:建议使用上述推荐的采样参数集。对于支持的框架,可将
presence_penalty参数调整至0到2之间以减少无休止的重复。但使用较高值可能会导致语言混合和模型性能轻微下降。 - 充足的输出长度:为优化智能体任务性能,建议分配足够的输出长度,使模型能够生成详细且全面的响应。对于支持内部推理和最终输出分别设置令牌限制的框架,建议在100万上下文长度内进行如下配置:推理内容最大输出长度设为262,144个令牌;最终响应最大输出长度设为131,072个令牌。
- 处理超长文本:Qwen3.8-27B原生支持最长262,144个令牌的上下文长度。对于总长度(包括输入和输出)超过此限制的长期任务,建议使用RoPE缩放技术(如YaRN)来有效处理长文本。YaRN目前受vLLM、SGLang和TokenSpeed等推理框架支持。通常有两种启用YaRN的方法:修改模型配置文件或在启动引擎时传递命令行参数。请注意,所有主流开源框架都实现了静态YaRN,这意味着缩放因子不随输入长度变化,可能会影响短文本的性能。建议仅在需要处理长上下文时才修改
rope_parameters配置,并根据实际应用场景调整factor参数。 - 长视频理解:为优化纯文本和图像的推理效率,发布的
video_preprocessor_config.json中的size参数配置较为保守。建议将longest_edge参数设置为469,762,048(对应224k视频令牌),以便对时长数小时的视频进行更高帧率的采样,从而获得更优性能。
引用
如果您觉得我们的工作有帮助,欢迎引用我们。
评论总结
根据评论内容,总结如下:
主要观点与论据:
性能突破与本地运行潜力(高认可度):
- 多数评论认为Qwen3.8-27B是“游戏规则改变者”,在消费级硬件上实现了接近Claude Opus 4.6的性能。
- 关键引用:TomGarden称“3.7 27B是消费硬件上尺寸与智能的最佳平衡”;NorwegianDude表示“本地模型可与半年前的Claude Opus 4.6 Max一较高下”。
基准测试争议与谨慎态度(中等认可度):
- 部分用户质疑基准测试的真实性,认为可能存在“benchmaxxing”(为刷分优化)。
- 关键引用:anana_警告“希望不是刷分”;xlayn直言“很难相信27B模型能媲美Opus 4.6”。
实际应用与硬件适配(高认可度):
- 用户关注模型在RTX 4090、M4 Max等设备上的运行效率,并分享量化配置(如GGUF、NVFP4)。
- 关键引用:erdaltoprak提供“DGX Spark vLLM NVFP4和RTX 4090 llama.cpp GGUF配置”;kristopolous报告“q4km在4090上约48 tps”。
对后续版本的期待(中等认可度):
- 用户希望推出更小(如10B)或MoE架构的变体,以平衡性能与资源消耗。
- 关键引用:tosh希望“有新的~10B变体”;KronisLV期待“35B A3B或类似MoE模型”。
平衡性总结: - 积极面:模型在DeepSWE等基准上超越Opus 4.6,且支持多模态,被视为“本地模型未来”的里程碑。 - 谨慎面:部分用户强调需等待独立验证,并指出小模型在长尾任务(如工具调用)中可能不如大模型稳定。 - 技术细节:量化版本(如1bit)在低内存设备上表现惊艳,但存在会话切换时的性能衰减。