Hacker News 中文摘要

RSS订阅

克劳德·奥普斯 5 -- Claude Opus 5

文章摘要

Claude Opus 5正式发布,性能接近前沿模型Claude Fable 5,但价格仅为后者一半。它在编程和知识工作评估中达到新高度,适合日常使用,效率更高,成为Claude Max的默认模型和Claude Pro的最强模型。

文章总结

好的,这是根据您的要求,对原文进行中文重述和精简后的版本:

标题:Claude Opus 5 发布

Claude Opus 5 今日正式发布。这是一款深思熟虑且积极主动的模型,其智能水平接近 Claude Fable 5,但价格仅为后者的一半。

在编码和知识工作评估(如 Frontier-Bench 和 GDPval-AA)中,Opus 5 达到了新的最高水平,但在网络安全任务上仍落后于 Mythos 5。

Opus 5 专为日常使用而设计,工作效率高于其他模型。它将成为 Claude Max 的新默认模型,也是 Claude Pro 上最强的模型。

性能与成本效益

与上一代 Opus 4.8 相比,Claude Opus 5 在相同成本下提供了大幅提升的性能。用户可以通过调整模型的“努力程度”设置,来优化智能水平或节省令牌以获得更快、更便宜的结果。

Opus 5 在软件工程任务上表现出色。例如,在 Frontier-Bench v0.1 上,它超越了所有其他模型,并以更低的单次任务成本,实现了超过 Opus 4.8 两倍的性能。在 CursorBench 3.2 上,以最大努力运行时,其性能与 Fable 5 的峰值分数相差不到 0.5%,但单次任务成本减半。

在知识工作和问题解决任务上也有类似结果:

  • 在 ARC-AGI 3 评估中,Opus 5 的得分是次优模型的三倍。
  • 在 Zapier AutomationBench 上,Opus 5 的通过率约为次优模型的 1.5 倍,且成本相同。即使在其最低努力设置下,它完成的任务也比任何其他模型都多。
  • 在 OSWorld 2.0 基准测试中,Opus 5 在任意成本下都优于其他所有模型,以略高于 Fable 5 三分之一成本的价格超越了其最佳结果。

在科学研究方面,Opus 5 相比 Opus 4.8 有显著提升。它在所有生命科学评估(涵盖结构生物学、有机化学和生物信息学)上的表现都更好。在有机化学任务(如从光谱数据推断分子结构)上,其内部基准得分比 Opus 4.8 高出 10.2 个百分点;在预测蛋白质序列变异如何影响其功能的任务上,得分高出 7.7 个百分点。

与 Claude Opus 5 协作

Opus 5 在验证自身工作和仔细迭代直至成功方面能力更强。在评估和早期测试中,我们和用户发现了许多体现其主动性和彻底性的例子:

  • 在一个 Frontier-Bench 任务中,Opus 5 被要求根据一张机器零件的图纸编写代码,将其重建为 3D FreeCAD 模型,但故意不提供直接查看图纸的方式。Opus 5 通过编写自己的计算机视觉管线从原始像素中提取几何形状,成功重建了整个零件,并反复成功。没有其他模型能在五次尝试后解决这个问题。
  • 面对一个流行开源包管理器中的真实错误,Opus 5 找到了根本原因,并修复了社区补丁遗漏的一个边缘情况。而竞争模型只修复了表面症状。
  • 一家交易公司的工程师使用 Opus 5 在一个会话中为新交易所构建了市场数据源。之前的模型根本无法完成此任务。由于没有实时数据源进行验证,Opus 5 甚至构建了自己的测试工具来检查其代码是否正确解析了交易所的数据。

对齐与安全

  • 对齐: 在部署前测试中,Opus 5 是我们迄今为止最对齐的模型。它比 Opus 4.8、Sonnet 5 或 Fable 5 更遵守 Claude 的宪法;表现出最低的欺骗行为率;最不容易被诱导滥用。在避免可能造成难以逆转后果的鲁莽行为方面,它也是最安全的模型。
  • 安全: Opus 5 并未推进高风险、双重用途能力的前沿。在生物研究和进攻性网络安全方面,它仍落后于 Mythos 5。我们有意避免在网络安全任务上训练 Opus 5,但作为其通用能力提升的结果,该模型在这些任务上仍有显著进步,在“发现”网络安全漏洞方面接近 Mythos 5。然而,在将这些漏洞转化为实质性网络威胁的“利用”方面,它仍远落后于 Mythos 5。

Opus 5 的安全保障

Opus 5 的安全保障旨在允许其在网络安全和生物学领域的良性用途。与 Opus 4.8 类似,但在少数网络安全任务上加强了防护栏。其网络安全分类器的限制性低于 Fable 5,允许在源代码中查找漏洞,但阻止二进制漏洞扫描、渗透测试和漏洞利用生成。被标记的请求将默认回退到 Opus 4.8。我们的网络安全验证计划(CVP)为企业和研究人员提供了限制更少的 Opus 5 版本。

开始使用

Claude Opus 5 即日起在所有平台上可用,定价与 Opus 4.8 相同(每百万输入令牌 5 美元,每百万输出令牌 25 美元)。开发者可通过 Claude API 使用。它还提供快速模式,速度约为默认速度的 2.5 倍,价格为基本价格的两倍。

同时,我们发布了两个测试版更新:Claude 平台上的“对话中工具更改”和 API 上的“自动回退”。Opus 5 没有数据保留要求。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 性能与成本平衡受关注:评论2(briandoll)指出“Very interesting to see such a focus on cost for performance here”,评论9(zuzululu)认可“so almost fable 5 with 50% cheaper cost? sign me up”,强调Opus 5在接近Fable 5性能下成本更低。

  2. 模型定位模糊引发困惑:评论5(datakan)质疑“Ok then so what's the point?”,评论20(cebert)表示“I am very confused about what the difference between Opus 5 and Fable 5 is now”,认为两者相似性高,缺乏明确区分。

  3. 安全限制影响实用性:评论19(not_a9)认为“Okay so it’s worse than Opus 4.8 for my purposes I guess?”,评论22(Sol-)批评“extremely sabotaging and unspecific bio safeguards”,指出安全分类器可能使模型不可用。

  4. 基础设施问题突出:评论11(atraac)抱怨“Constant bugs, dropped sessions, errors... It's becoming ridiculous”,反映现有服务稳定性差。

  5. 行业竞争与模型路由趋势:评论21(paxys)指出“model routing is the fastest growing segment in AI”,认为模型过多导致用户需依赖路由服务。

平衡性总结: - 正面:性能提升、成本优化(评论2、9) - 负面:安全限制、模型定位模糊、基础设施问题(评论19、20、11) - 中立:对基准测试饱和、行业竞争格局的观察(评论14、21)