Hacker News 中文摘要

RSS订阅

将生产级AI代理迁移至GPT-5.6:速度提升2.2倍,成本降低27% -- Migrating a production AI agent to GPT-5.6: 2.2x faster, 27% cheaper

文章摘要

Ploy公司将其生产环境中的AI代理从Claude Opus迁移至OpenAI新发布的GPT-5.6 Sol模型。经过四个月测试,GPT-5.6首次在构建营销网站等复杂任务上超越Opus,虽然初期存在失败模式,但构建速度提升超过一半。

文章总结

好的,这是根据您的要求,对原文进行中文重述和精简后的版本:

标题:将生产环境中的AI智能体迁移至GPT-5.6

核心内容:

从今天起,Ploy的AI智能体已运行在OpenAI最新发布的旗舰模型GPT-5.6 Sol上。此前数月,我们一直未能找到能超越Claude Opus的模型,但GPT-5.6 Sol改变了这一局面。经过与Claude Opus的直接对比测试,我们已将其设为所有Ploy工作区的默认模型。

这一转变意义重大。Ploy的智能体负责构建和编辑真实的营销网站,从规划页面、读取代码库、编写组件、生成图像,到自我截图并判断任务完成,对模型的要求极高。在Claude Opus占据默认位置的四个月里,没有其他模型能击败它,而GPT-5.6是第一个做到的。

尽管首次评估并非完美,但它的表现极为出色,带来了立竿见影的承诺:构建时间缩短一半以上,成本降低27%,且完成工作的评分达到或超过原有模型。这些数据足以让我们投入真正的迁移工作。

尽管我们使用了通用的LLM SDK,但从Claude Opus 4.8切换到GPT-5.6 Sol,仍需逐一发现并解决那些我们视为“模型特性”的、实则由供应商决定的行为差异,例如工具参数的填充方式、提示缓存机制以及推理过程的回放方式。

以下是迁移过程中的关键步骤:

第一步:修复评估框架 我们的评估套件使用真实智能体在真实工作区上运行数百个案例。在跨模型运行时,我们发现评估框架本身存在对原有模型的隐性依赖。例如,工具调用预算、文件读取方式等假设,导致约三分之一的失败案例源于框架本身而非模型行为。因此,在信任新模型的通过率之前,必须先排查并修复这些框架问题,确保评估的公平性。

第二步:检查工具调用 GPT-5.6在调用工具时,会为所有可选参数都填充一个看似合理的值(如offset: 0),这与Claude只发送实际使用参数的行为不同。这导致我们的文件读取实现将这些虚构值当作真实参数处理,造成大量空文件读取。通过将可选参数重写为“必需但可为空”的模式,并在工具执行前剥离空值,我们解决了这个问题,使空文件读取率从52%降至0%,工具调用次数也减少了约30%。

第三步:重建提示缓存 这是最具启发性的工程差异。表面上两家供应商都提供“提示缓存”,但设计完全不同。GPT-5.6改变了OpenAI的缓存模型,不再支持隐式部分前缀匹配,而是要求使用显式的缓存断点和缓存键。我们最终采用“按工作区划分缓存键”的策略,并拆分系统提示,使得新会话的首次调用缓存命中率从约0%提升至83.7%,总未缓存输入令牌减少28%,成本最终低于Claude Opus。这表明,成本差异很大程度上源于缓存配置不当,而非模型定价本身。

第四步:确保推理回放的自包含性 GPT-5.6的响应API默认使用服务器端引用回放之前的推理过程,这导致对话中途出现间歇性失败。通过设置store: false,我们让SDK请求加密的推理内容,并回放自包含的数据块而非服务器状态指针,从而解决了问题。

总结: GPT-5.6 Sol已准备好用于Ploy。它构建的页面速度快了2.2倍,成本降低了27%,输出令牌数减少约一半,且设计评分更高。尽管其设计风格偏向于干净、现代的网格布局,但通过我们的设计工程团队引导,可以实现世界级的品牌一致性。

评论总结

根据评论内容,总结主要观点如下:

1. 模型性能与成本权衡 - 正面:GPT 5.6 Sol在营销网站构建任务中表现优异,速度快、成本低(评分None,作者blfr引用:"builds finishing in less than half the wall-clock time, at 27% lower cost") - 负面:Sol成本过高,建议部分任务使用Luna(评分None,作者bob1029引用:"Sol is great at talking to the human... but it's just too expensive to use everywhere")

2. 用户偏好与输出质量 - 部分用户更偏好Claude Opus的生成结果(评分None,作者estebarb引用:"personally I strongly preferred Claude Opus in all cases") - 批评LLM写作风格,如短句分隔、缺乏润色(评分None,作者kristianp引用:"The way the LLMs write... with short phrases separated by colons... is so poor and frustrating")

3. 迁移与部署体验 - 正面:模型升级简单,对多数公司只需一行代码(评分None,作者thiagoperes引用:"a model upgrade like this is basically a one liner") - 正面:缓存机制使Deepseek等模型成本极低(评分None,作者arikrahman引用:"cache hits on Deepseek make requests practically free")

4. 实用性与信息密度 - 文章信息密集、实用性强(评分None,作者hankbond引用:"a dense informative article with practical takeaways") - 但可读性差,需改进(评分None,作者kristianp引用:"it isn't easy to read")

平衡性总结:评论对GPT 5.6 Sol的性能提升和成本降低持肯定态度,但对其输出质量、可读性及成本效益比存在分歧。部分用户更看重模型一致性(如redfather918)和用户偏好(如estebarb),而非单纯的技术指标。