文章摘要
文章指出,新一代Claude模型(如Opus 4.8和Sonnet 5)在调用Pi的编辑工具时,会凭空添加不符合模式的字段,导致工具调用被拒绝。这种现象在旧模型中不存在,说明新模型在特定工具模式上的表现反而更差。
文章总结
好的,这是根据您的要求,对原文主要内容进行的中文重述,保留了关键细节,并删减了与核心主题无关的内容。
标题:更好的模型,更差的工具
核心问题: 新版Anthropic模型(如Opus 4.8和Sonnet 5)在调用特定工具(如Pi的编辑工具)时,会在工具参数中凭空捏造出一些不存在的键(例如requireUnique、oldText2等),导致工具调用失败。尽管这些模型更智能,但在遵循特定工具模式方面,表现反而不如旧版模型。
问题根源分析:
工具调用的本质: 大模型的工具调用并非魔法,而是通过文本生成实现的。模型根据提示和工具描述,生成一段特定格式的文本,API再将其解析为工具调用。例如,一个编辑工具的参数可能被序列化为类似XML的标记,其中嵌套的数组则通过JSON字符串表示。
失败的具体表现: 在Pi的编辑工具中,模型本应生成一个包含
oldText和newText的edits数组。但新版模型会在每个编辑对象末尾添加各种奇怪的额外键,如type、id、unique、matchCase等。最令人困扰的是,这些错误调用中,真正需要替换的oldText和newText内容本身是正确的,只是多了无意义的尾巴。问题为何恶化(核心假设): 作者认为,这不是随机的性能退化,而是训练过程导致的“人工制品”。
- 后训练适应: 新版Anthropic模型的后训练过程,很可能大量使用了类似其闭源工具“Claude Code”的环境。Claude Code的编辑工具模式相对扁平(如
file_path,old_string,new_string),并且其客户端代码非常“宽容”,会自动修复参数别名、过滤未知键等错误。 - 强化学习的副作用: 在这种宽容的环境中进行强化学习,模型即使生成了略微错误的工具调用(如添加了无关字段),任务仍能完成并获得奖励。这导致模型没有动力去精确遵循其他工具的模式,反而形成了对Claude Code特定模式的强烈“先验”。
- 分布外问题: 当模型面对一个语义相同但模式不同的工具(如Pi的嵌套
edits数组)时,这个新模式就变成了“分布外”数据。模型越强,其固化的先验就越难被打破,因此表现反而更差。
- 后训练适应: 新版Anthropic模型的后训练过程,很可能大量使用了类似其闭源工具“Claude Code”的环境。Claude Code的编辑工具模式相对扁平(如
对工具开发者的启示:
- 工具模式并非中立: 尤其是在Anthropic模型上,工具的模式设计至关重要。某些模式(如顶层属性)更接近模型后训练时见到的格式,而另一些(如嵌套数组中的长JSON字符串)则更难生成。
- 闭源生态的挑战: Claude Code是闭源的,其内部使用的工具模式和容错机制不透明。其他工具开发者无法假设模型能完美适应自己的工具,除非其模式与Claude Code高度相似。后训练越集中在某个主导工具上,其他工具就越需要“继承”它的怪癖。
- 严格约束的价值: 作者原本对严格的语法约束采样持保留态度,但这个问题改变了他的看法。启用Anthropic的
strict模式可以解决此问题,因为它会阻止模型采样不符合JSON模式的键。这表明,在模型能力提升的同时,工具调用框架需要提供更强的格式保证。
总结: 新版Anthropic模型在调用非标准工具时表现更差,这很可能是其针对Claude Code进行后训练的副作用。这提醒我们,工具模式的设计和模型的后训练生态紧密相关,闭源生态下的模型行为可能无法完美迁移到其他工具上。
评论总结
评论总结
核心观点:模型工具调用存在“生态锁定”问题
1. 模型被训练成适应特定工具生态(评分:高认可度) - 评论指出,模型在强化学习训练中会适应特定工具格式,导致对其他工具格式的兼容性差。 - 关键引用: - "Tool schemas are somewhere in the distribution and some shapes are close to what the model saw during post-training and some are far away." (wxw) - "Train a model in a forgiving environment and other runtimes end up inheriting its habits." (aberrahmane_b)
2. 封闭生态与开放生态的矛盾(评分:中高认可度) - 评论认为,闭源模型在专有工具中表现最佳,但限制了开放生态的发展。 - 关键引用: - "Proprietary frontier models performing best in proprietary harnesses makes sense for Anthropic's interests." (wxw) - "Open source developer surprised and concerned by the trajectory their favorite proprietary software is taking." (ares623)
3. 解决方案:灵活设计+错误恢复(评分:中认可度) - 部分评论提出通过灵活的工具设计、良好的错误提示和重试机制来缓解问题。 - 关键引用: - "Rather than trying to conform to one particular format, my approach is to design flexibly enough to handle a wide array of possible inputs." (simonreiff) - "This is easily solved with good error messages... The agent tries again and always gets it right." (cadamsdotcom)
4. 历史类比:类似早期浏览器兼容性问题(评分:低认可度) - 少数评论将当前问题类比为早期HTML/CSS浏览器兼容性问题。 - 关键引用: - "It reminds me of the ancient times when browsers all read HTML and CSS differently." (lukasco)
平衡性说明
- 多数评论(约70%)认同模型工具调用存在生态锁定问题
- 约20%的评论提出实用解决方案(灵活设计、错误恢复)
- 约10%的评论持历史类比或技术细节讨论