文章摘要
Qwen 3.8 27B是一款性能出色的开源大语言模型,但默认会过度思考,导致输出冗长。
文章总结
好的,这是根据您的要求,对原文主要内容进行的中文重述,已保留关键细节并删减了与主题无关的内容。
文章标题:Qwen 3.8 27B 模型评测:性能出色,但默认“过度思考”
核心内容:
阿里通义千问实验室发布了开源模型 Qwen 3.8 27B(27B参数,Apache 2.0许可)。该模型大小适中,可在配置不错的笔记本电脑上运行,其前代产品表现已令人印象深刻。
主要亮点与问题:
性能强劲:模型自报的基准测试成绩亮眼,甚至超越了自家更强的闭源模型。作者在128GB内存的M5 Max MacBook Pro和NVIDIA DGX Spark上均成功运行了该模型的17GB量化版本。
默认“过度思考”的搞笑问题:模型默认的推理强度为“xhigh”(极高),这导致它会对极其简单的问题进行过度复杂的分析。例如:
- 生成一个“骑自行车的鹈鹕”SVG图,在xhigh模式下耗时21分钟,使用了22,276个推理token。虽然最终生成的图片质量很高(自行车框架正确、鹈鹕有腿、翅膀触把、有背景),但等待时间完全不值得。
- 当被要求“画一个圆的SVG”时,模型在xhigh模式下花费数分钟“思考”,最终产出了一个精美的动态几何圆,完全偏离了用户“画一个简单圆”的原始指令。
关闭推理后的表现:关闭推理后,生成同一张鹈鹕图仅需2分钟,但图片质量有所下降(自行车框架变形,鹈鹕细节缺失)。这表明推理功能在提升输出质量上确实有效,但默认的“xhigh”级别过于极端。
实用建议与能力展示:
- 强烈建议:使用该模型时,应忽略其默认的“xhigh”推理设置,从“低”或“无”推理级别开始尝试。
- 边界框能力出色:模型能精准识别照片中的物体(如鹈鹕)并返回其边界框坐标。
- 代码生成与工具构建:模型能根据单次提示,在本地离线构建一个用于标注边界框的完整HTML工具。尽管因默认“过度思考”导致工具功能过于复杂,但最终效果很好。相比之下,关闭推理后生成的工具则存在坐标错误。
- 驱动编码代理:模型具备驱动编码代理(如Pi)所需的长上下文、代码生成和工具调用能力。它能成功分析项目代码库(如Datasette的认证机制),并编写Python脚本将日志文件转换为Markdown格式。
性能瓶颈与优化:
- 速度是短板:在作者的两台设备上,模型运行速度约为15-30 token/秒,远慢于云端API模型(如OpenAI的模型可达74-184 token/秒)。这是阻碍其成为日常主力模型的主要因素。
- 优化潜力:模型支持“多token预测”(MTP)技术,通过让模型快速验证廉价机制的猜测结果来提升推理速度。初步测试显示,启用MTP后,性能可提升约72%。社区预计未来几周会有更多加速方案出现。
总结与评价:
- 奇迹般的进步:一个仅17GB的文件能在个人电脑上完成如此复杂的任务(长上下文、工具调用、视觉识别、代码生成),堪称奇迹。一年前,这样的能力还只属于最昂贵、最强大的专有模型。
- 性能是唯一阻碍:模型在作者的两台设备上运行速度偏慢,这是其成为日常工具的唯一障碍,根源在于密集模型对内存带宽的高要求。
- 核心意义:Qwen 3.8 27B 证明了我们无需花费巨资购买数据中心级硬件,就能拥有一个功能全面的开源模型。此类规模的模型正以惊人的速度持续进步。
评论总结
根据评论内容,主要围绕模型“过度思考”(overthinking)问题展开讨论,观点存在分歧。以下是总结:
主要观点一:过度思考导致速度慢、效率低(认可度较高) - 密集模型的过度思考会显著降低速度,例如从Qwen 35BA3B到27B版本速度慢了7-8倍(andy99)。 - 在代理任务中,token效率是运营成本,宁愿选择简洁模型处理困难案例(deadcatfound)。 - 实际案例中,某模型在双GPU上耗时11小时完成任务,而GPT 5.5仅需20分钟(SwellJoe)。
主要观点二:可通过技术手段缓解(认可度中等)
- 使用--thinking-budget和--thinking-message参数可控制思考过程,避免递归(cyanydeez)。
- 设置"reasoning_effort":"none"并引导模型按步骤执行,可减少过度思考(xscott)。
- 存在4个思考级别,可默认禁用(blagui),或通过Jinja模板修复(xscott)。
主要观点三:过度思考是普遍现象,但有其价值(认可度中等) - 所有前沿模型都存在过度思考,源于RL激励(jatora)。 - 过度思考能提升任务完成质量,例如Opus 4.8虽慢但结果优秀(matheusmoreira)。 - 用户可享受思考过程,但需平衡速度与质量(johnnyApplePRNG)。
主要观点四:对模型发展持乐观态度(认可度较低) - 本地模型已能媲美一年前高端模型的推理能力(RachelF)。 - 期待更多简洁模型出现,如Muse 30B(andy99)。
关键引用(保留中英文) - "The big problem with overthinking on a dense model is obviously the speed hit you take." (andy99) - "For agents, token efficiency is an operating cost. I’d rather have a terse model that escalates hard cases." (deadcatfound) - "I hope Apple does end up moving to HBM. Unified memory has been a huge godsend, but the low memory bandwidth is just such a killer." (LoganDark) - "All current era models overthink as it’s a product of their RL incentives." (jatora)