Hacker News 中文摘要

RSS订阅

Qwen3.8-Max:编程与协作的新标杆 -- Qwen3.8-Max: A New Bar for Coding and Cowork

文章摘要

Qwen3.8-Max正式发布,这是Qwen系列最强模型,拥有2.4万亿参数,在编程、工作、研究等任务上全面提升,能端到端可靠完成复杂任务,下周将开源权重。

文章总结

好的,这是根据您的要求,对原文主要内容进行的中文重述,已保留关键细节并删减了与主题无关的内容(如具体的API代码示例、配置文件和引用格式)。


标题:Qwen3.8-Max:编程与协作的新标杆

核心发布信息

今天,我们正式发布Qwen系列迄今为止最强大的模型——Qwen 3.8-Max。这也是我们首次开源Max级别模型的权重,开源权重将于下周发布。该模型基于Qwen 3.5的架构,参数规模扩展至2.4万亿,在编程、工作、研究和长周期任务上实现了全面改进。它不仅能回答更具挑战性的问题,还能更可靠地端到端完成复杂任务,交付可信赖的成果。

编程能力

对于顶级模型而言,如今的编程远不止按要求编写一个函数,而是能够自主地将一个持续数天的真实项目从零开始完成。我们在三个挑战中测试了Qwen3.8-Max,所有结果都通过实际编写和运行代码获得,没有任何人工帮助。其核心能力在于,它不会固守一个计划,而是通过反馈循环实现自我进化

  1. 超过10天的自主编程:构建自我进化的框架 模型被要求从零开始创建oh-my-cli项目,并构建一个自我进化的框架。它将用户反馈、社区实践和自身测试结果整合到一个工程循环中:需求被标准化为问题,由智能体自动认领并执行,通过代码、测试、预览和日志进行持续迭代。截至2026年7月30日,经过约16天的完全自主运行,该仓库已积累了265次提交、127个拉取请求和151个问题

  2. 复现并改进研究论文 我们交给模型一篇关于“大语言模型推理的统一数据选择”的研究论文,要求其复现论文实验并尝试做得更好。模型从零开始,在完全自主工作约5天(约125小时)后,编写了约7,600行代码,运行了33轮GPU训练。它首先复现了论文的六个主要发现,随后进入自我改进循环,提出并测试了18个改进想法,最终进化出一种新方法,在竞赛级数学基准AIME24上比论文方法高出2.7个百分点

  3. 在24小时内击败数百个人类团队 我们将模型提交到一个有526个人类团队参与的实时在线竞赛中。任务是通过阅读客服聊天记录(文本和截图)来识别客户意图。模型在严格的24小时时限内自主构建了完整解决方案,包括微调多个语言模型和视觉语言模型,并将它们整合到一个加权投票系统中。经过45次提交,其准确率从0.60稳步提升至0.853,击败了458个(87%)人类团队

工作能力

除了编程,处理多步骤、多工具的“真实工作”是前沿模型创造巨大经济价值的另一条主线。我们通过联合扩展强化学习环境和算力,在多个主流工作框架上普遍提升了模型的通用工作能力。这需要解决三个挑战:持续扩展解耦的真实环境、构建统一的奖励系统、以及使用在线数据平衡器来稳定训练。

我们测试了模型在数百个高经济价值职业中交付生产级成果的能力,例如:

  • 企业合规顾问:一次审查数百份文档,找出1,284条相关条款,耗时不到一小时,而人工团队通常需要约一周
  • UI/UX设计师:为数字银行应用一次性交付包含8个屏幕的高保真交互原型,零轮人工修改,而传统流程需要3-5轮修改。
  • 餐厅品牌创始人:阅读超过一百份食材供应简报,一次性生成包含26道菜的完整菜单,食品成本率控制在33.8%
  • 结构工程师:根据一套图纸,在浏览器中重建一栋30层办公楼的抗震结构模型,可实时查看各项参数,而传统流程通常需要超过一周
  • 康复治疗师:将一张2D纸质评估表转化为3D交互式演示,包含可旋转视角和解剖覆盖层,而传统外包需要2-4周数千美元
  • 体育数据分析师:在几十分钟内解析每位球员约8,400次攻防回合,生成球员战术档案和教练报告,而传统团队需要数个工作日

此外,模型还展示了在一个会话中构建端到端盈利量化策略的能力。它自主规划复杂工作流,并行挖掘因子,将传统需要数周至数月的量化研究压缩成一个可扩展的自动化循环。

长周期任务

在处理高度复杂、多约束的长周期任务时,模型展现了卓越的系统级自主规划和闭环自适应学习能力。

  1. 自主芯片设计与闭环优化 模型自主完成了从逻辑重构到物理布局生成的整个芯片设计流程,目标是一个加密硬件加速器。在完全自主运行中,模型完成了约500轮交互和71次评估,经历了13个关键里程碑。其首个功能可行的设计包含8,298个门,经过算法重写、冗余消除、模块融合等深度优化,最终将门数降至678个,领先所有被评估的模型。物理布局也从初始的106×106 µm²缩小到46×46 µm²,面积减少了81%,并成功实现了时序收敛。

  2. 长期运营中的持续学习 在一个模拟365天电商运营的基准测试中,模型需用10万元启动资金同时运营多家网店,应对季节波动、突发事件和现金流压力。模型展现了卓越的前瞻性规划能力,并在与近600个供应商的博弈式谈判中展现出持续学习能力,采购价格逐步降低。最终,模型实现了¥416,252的最高总余额(4.16倍回报),比第二名高出38%,比上一代旗舰模型提升了152%

多模态智能体

Qwen3.8-Max不仅能理解图像、文档和视频,还能将视觉智能贯穿整个任务生命周期。它能处理超过200页的PDF并提取关键信息,也能处理超过100小时的视频并构建“视频记忆图谱”。更重要的是,视觉不再局限于输入阶段,而是成为规划、执行、验证和迭代的原生反馈循环。模型在执行过程中持续观察和评估自己的中间结果,发现问题后能自主修正。

为此,我们引入了RecreationBench基准,用于评估模型在多个平台上通过“编码”和“GUI操作”相结合的混合智能体能力,以从零复现一个应用。Qwen3.8-Max在此基准上展现了前沿水平。

用户反馈

来自顶级智能体平台、开源算法团队、专业公司、初创企业和学术研究人员的反馈一致认为:Qwen3.8-Max能够驱动长周期、自主的任务链,并一次性交付可直接上线的成果。

总结

Qwen3.8-Max是我们迄今为止最强大的模型,也是首个Max级别的开源权重模型。其2.4万亿参数规模在编程、真实工作、长周期任务和多模态智能体方面带来了全面提升,能够以最少的人工干预,端到端地完成复杂、开放的目标,并交付可靠的成果。开源权重将于下周发布。

评论总结

根据评论内容,主要观点和论据如下:

1. 开源权重与发布节奏(认可度较高) - 评论关注Qwen 3.8-Max是否仍保持开源权重,以及发布时间的混乱。用户指出官方7月19日已宣布“即将开源”,但8月又重复类似声明,质疑实际进展。 - 关键引用:VladVladikoff:“Are these latest Qwen models still open weights or has Qwen moved away from that?”;simonw:“That was on July 19th... So what are they releasing today?”

2. 模型性能与本地部署(认可度较高) - 用户对Qwen 3.8-27B的开源表示期待,认为3.6-27B已是本地最佳模型之一,希望3.8能进一步改进。 - 关键引用:toshinoriyagi:“Qwen3.6-27B is widely regarded as one of the best local models... If 3.8 truly improves upon it that would be awesome.”;boredatoms:“3.8 27b is the real news here.”

3. 成本与定价(认可度中等) - 用户关注模型使用成本,希望比DeepSeek更便宜,并质疑“自我进化”是否意味着蒸馏其他模型(如Claude)。 - 关键引用:ddxv:“I hope this is significantly cheaper... hard to justify switching from cents per day.”;choppaface:“Does this mean they distilled Claude?”

4. 竞争与市场信号(认可度较低) - 部分用户对阿里巴巴的声明持怀疑态度,认为其与Anthropic等公司的竞争存在营销成分,并预测一旦OpenAI和Anthropic上市,此类声明将成为卖出信号。 - 关键引用:TacticalCoder:“Sure, it's apples to oranges... part of me thinks they know fully well what they did there.”;adi2907:“Once OpenAI and Anthropic are public, every such announcement will become a reliable sell signal.”

5. 技术细节与基准(认可度较低) - 用户建议需要“自我进化基准”来评估模型递归改进能力,并质疑模型能否剥离非编码功能以减轻体积。 - 关键引用:BeriV2:“We will eventually need a self evolution benchmark...”;kopirgan:“Can a model be stripped off anything not relevant to coding and get a lot lighter?”

总结:评论整体对Qwen 3.8系列的开源和性能改进持积极期待,但对发布节奏、成本、竞争策略及技术细节存在质疑。用户普遍关注本地部署能力、定价透明度,并警惕营销话术。