Hacker News 中文摘要

RSS订阅

GLM-5.3:具备新兴网络能力的前沿编程 -- GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

文章摘要

GLM-5.3通过扩展后训练,在复杂编程和长周期任务上显著提升,相比5.2版编码能力提高50%,并在网络漏洞发现等前沿领域实现突破性进展,性能翻倍。

文章总结

好的,这是根据您的要求,对原文主要内容进行的中文重述:

标题:GLM-5.3:具备新兴网络能力的尖端编程模型

核心要点: GLM-5.3 的所有性能提升均源于“后训练”阶段的规模化扩展,其基础模型与 GLM-5.2 相同。通过在更丰富的环境和任务上进行强化学习(RL)训练,模型在复杂编程和长期任务上取得了显著进步。

主要提升:

  1. 更强的编程能力: GLM-5.3 是目前开源模型中编程能力最强的。在内部基准测试 Z.ai Code Bench 上,其性能相比 GLM-5.2 提升了 50%。在 Terminal Bench 3.0 和 Agents' Last Exam 等公开基准测试中也达到了开源模型的顶尖水平。其进步不仅体现在短任务上,在需要长期规划和执行的复杂任务(如 DeepSWE v1.1)上同样表现优异。

  2. 涌现的网络能力: 随着后训练的扩展,模型在网络攻防方面的能力发展速度超出预期。GLM-5.3 在漏洞发现基准测试 CyberGym 上达到了业界领先水平。更令人惊讶的是,它在漏洞利用链的后端环节(即从发现漏洞到实际利用)能力提升最为显著,相关基准测试成绩相比 GLM-5.2 翻了一倍多。在与真实世界代码库的测试中,该模型在 269 个项目中发现了 2,436 个漏洞,其中 1,097 个为中高危漏洞,部分漏洞已存在数十年之久。

  3. 开源计划: 模型权重将在发布两周后,待安全评估和加固完成后公开。

技术实现:

  • 环境规模化: 为了训练模型处理更接近真实专家工作的任务,团队构建了自动化流程来合成大量可执行、可验证且贴近实际工作的任务环境。这些环境模拟了工程师日常面对的复杂工作流,要求模型端到端地解决问题。
  • 强化学习策略: 沿用了 GLM-5.2 引入的 SAO(带压缩的强化学习)等策略,确保在长期任务上的性能提升。
  • 训练框架 slime: 所有训练都运行在开源的 slime 框架上。该框架通过优化训练-推理一致性、资源效率和系统吞吐量,使得大规模、长周期的强化学习训练变得高效可行。例如,针对长期编程任务,系统级优化使端到端训练吞吐量提升了 2.3 倍以上。

总结: GLM-5.3 通过在更逼真、更复杂的任务环境上进行大规模的强化学习后训练,在编程和网络安全领域实现了显著的性能飞跃,尤其是在需要长期规划和多步骤推理的任务上。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 模型性能强劲,接近顶尖水平:多数评论认可GLM-5.3的出色表现,认为其性能“惊人”(Incredible numbers),甚至“仅以微弱差距落后于Sol和Fable”(This is absolutely still shy of Sol and Fable, but only just by a hair)。有评论指出,通过后训练(post-training)即可实现长程任务扩展,这曾是Fable的优势(Feels like Fable's edge ended up just being long horizon task scaling, which post-training seems to achieve as seen here)。

  2. 开源与闭源模型的竞争格局:评论强调开源模型对闭源模型的制衡作用,认为“开源模型让闭源模型保持诚实”(Love these open source models keeping close source models honest)。同时,有评论担忧中国模型转向限制性许可(restricted-usage license),认为这是“从开源文化倒退”(a step back from the open source Chinese LLM culture)。另有评论指出,若无开源模型,用户将被迫支付高昂费用(we'd probably have to reverse mortgage our homes to pay for tokens)。

  3. 对模型发布节奏与实用性的观察:部分评论指出模型发布密集,普通用户难以抉择(A flood of releases today, really difficult to make out)。也有评论认为,尽管性能接近,但经济上仍无充分理由放弃OpenAI(There's still not a compelling economic reason to drop OpenAI)。

  4. 对模型发展方向的探讨:有评论质疑,在互联网数据耗尽后,模型进步是否主要依赖后训练和架构改进(how will models continue to get better? Post training it seems?)。另有评论指出,参数规模与性能不再直接相关(parameter count doesn’t seem to be a direct correlation anymore)。

  5. 对团队与沟通风格的认可:有评论赞赏Z.AI团队的沟通风格,认为其“不像硅谷营销垃圾,更像研究者所写”(written less like SV marketing hype trash and more like researchers wrote it),并归因于领导层为大学教授(when the top of your org are actual university professors)。

关键引用(保留中英文):

  • 性能认可:“This is absolutely still shy of Sol and Fable, but only just by a hair.”(仍略逊于Sol和Fable,但仅差毫厘。)
  • 开源价值:“Love these open source models keeping close source models honest.”(开源模型让闭源模型保持诚实。)
  • 许可担忧:“Kimi and QWEN are now moving on to a restricted-usage license... a step back from the open source Chinese LLM culture.”(Kimi和Qwen转向限制性许可,是中国开源文化的倒退。)
  • 发展疑问:“how will models continue to get better? Post training it seems?”(模型如何继续进步?似乎靠后训练?)
  • 沟通风格:“written less like SV marketing hype trash and more like researchers wrote it.”(不像硅谷营销垃圾,更像研究者所写。)