文章摘要
作者对比了Claude Fable 5和GPT-5.6 Sol在NP难优化问题上的表现,发现Fable 5表现极佳,而/goal模式并非万能,有时能改善结果,有时反而让错误思路深化。
文章总结
好的,这是根据您的要求,对原文进行的中文重述,保留了核心细节,并删减了与主题无关的冗余内容。
标题:Fable 5 对决 GPT-5.6 Sol:在 NP 难问题上,/goal 指令真的有用吗?
核心结论: 我让 Claude Fable 5 和 GPT-5.6 Sol 分别在有/无原生 /goal 模式的情况下,解决同一个未公开的 NP 难优化问题。结果显示,Fable 5 表现极其出色,而 /goal 模式并非决定性的“游戏规则改变者”。
背景: 这是一个曾在黑客马拉松中使用的运筹学问题。我本人曾花费一周时间用 C++ 编写解决方案,因此拥有一个有效的人类基准。
Fable 5 在此基准测试中表现惊人。它不仅给出了全局最优解,其稳定性也是我从未在其他模型上见过的。这展现了纯粹的原始智能,令人难以置信。
另一个结果是,/goal 并非一个通用的“再努力一把”开关。它会改变模型的控制循环和搜索路径。有时这能帮助找到更好的解,有时则会让一个糟糕的想法持续更久,导致结果更差。
所有代码、提示词、结果表格、排除项和轨迹记录均可在 CLIArena 中找到。
问题描述
KIRO 是一个光纤网络设计问题。给定格勒诺布尔、尼斯和巴黎三个城市的定向距离矩阵,求解器需要连接分配点和终端,形成环路和短链,同时满足多项结构约束。优化目标是使总电缆长度最小。
一个有效的网络由以分配中心为根节点的冗余环路组成,环路上有悬挂着短分支的塔。每个塔必须恰好出现一次,且反转电缆段会改变其成本。
搜索空间有多大? 以巴黎为例,即使忽略排序和分支,仅将 532 个终端分配给 11 个分配中心,就有 11^532 种可能。一个更强的下界来自一种严格受限的有效解:恰好 19 个环路,每个环路 28 个终端,无分支。其可能的解数量约为 10^1223。
测试设置
| 设置项 | 值 |
| :--- | :--- |
| 模型 | Claude Fable 5, Opus 4.8, Sonnet 5; GPT-5.6 Sol, Terra, Luna |
| 模式 | 普通模式;原生 /goal 模式 |
| 优化预算 | 30 分钟 |
| 外部代理超时 | 1900 秒 |
| 推理设置 | 所有模型均设为最高可用级别 |
| 执行环境 | Harbor 0.1.43, Docker, 订阅认证 |
结果
在旗舰模型(Fable 5 和 Sol)上,我重复了三次匹配运行。
结果表格(节选):
| 模型 | 运行 | 普通模式 | /goal 模式 | 差值 |
| :--- | :--- | :--- | :--- | :--- |
| Fable 5 | 1 | 32,197 | 31,934 | -263 (更好) |
| Fable 5 | 2 | 32,516 | 32,324 | -192 (更好) |
| Fable 5 | 3 | 32,446 | 35,178 | +2,732 (更差) |
| GPT-5.6 Sol | 1 | 33,581 | 39,371 | +5,790 (更差) |
| GPT-5.6 Sol | 2 | 35,539 | 32,703 | -2,836 (更好) |
| GPT-5.6 Sol | 3 | 33,663 | 33,313 | -350 (更好) |
分析:
* 胜率: /goal 在六次试验中赢了四次,看起来很有用。
* 均值: 然而,两个模型在 /goal 模式下的平均表现都更差(Fable 5 差 759 分,Sol 差 868 分)。
* 结论: /goal 通常能带来小幅提升,但偶尔会导致大幅倒退。这就是它“赢得多,但均值更差”的原因。
* 模型对比: Fable 5 明显更强。其普通模式的平均分比 Sol 好 1,875 分,且稳定性极高(波动范围仅 319 分),而 Sol 的波动范围高达 1,958 分。
深入解析 /goal 指令
Claude Code 和 Codex 都提供 /goal 功能,但实现方式截然不同。
- Claude Code: 使用一个独立的小型评估模型(默认为 Haiku)来检查对话记录,判断目标是否达成。它无法使用工具或检查文件。
- Codex: 将目标作为持久化线程状态。主模型拥有
create_goal、get_goal和update_goal等工具。当线程空闲时,Codex 会注入一个包含目标和完成审计的延续轮次。这相当于让模型自己评估自己的工作。
为什么 /goal 能赢多数轮次,却仍是一个糟糕的默认选项?
在普通编码任务中,进度通常是可见的。但在优化任务中,一旦代理选择了求解器,额外的时间既可以放大一个好的决策,也可以放大一个坏的决策。
这正是本次实验的情况。/goal 在帮助 Fable 维持其快速编译的求解器组合,或 Sol 成功的链式重分区时,起到了积极作用。但当 Fable 构建了一个慢速求解器,或 Sol 决定进行穷举锚点扫描时,/goal 反而加剧了负面结果。中位数略有改善,但坏结果的尾部却大幅恶化。
局限性
这只是一个未公开的 NP 难任务,并非通用的编码排行榜。只有 Fable 和 Sol 拥有三次干净的匹配运行。其他对比混杂了不同的提示词、封装版本和时间限制。
总结
我放在标题中的结论并非 /goal 有帮助或有害。而是:一个持久化功能可以在赢得大多数单次试验的同时,使观察到的平均性能变得更差。 在一个困难的优化问题上,循环本身的质量远不如循环持续执行的内容的质量重要。
评论总结
根据评论内容,总结如下:
主要观点与论据:
/goal指令效果显著(评论3、7):用户o10449366分享使用/goal替代计划模式的经验,认为强制AI花时间写设计文档能产生更稳健的计划,节省迭代时间。Tenoke指出/goal有助于AI在长会话中记住关键指令,避免遗忘。- 关键引用:"/goal has replaced plan mode for me...Even just spending 10 minutes forcing GPT to write a design doc results in much more robust plans than plan mode"(评论3)
- "Claude seems to forget what you tell it in very long work sessions...I dont use goal (I guess I should), but presumably it makes it actually remember the most important instruction"(评论7)
对评估方法的质疑(评论5):andai认为结果多为噪声,每个模型仅一次评估,在需要多次尝试才能解决的大问题空间中缺乏可靠性。
- 关键引用:"Results seem mostly noise to me. One eval per model, in a large problem space"(评论5)
AI在复杂问题上的局限性(评论9):varispeed指出AI对复杂问题完全无用,训练数据偏差导致输出随深入而恶化,甚至破坏原有文档质量。
- 关键引用:"Both are entirely useless on complex problem, because they have a bias in training data...The answers are getting worse and worse as you dive deeper"(评论9)
图表呈现问题(评论2):tyleo指出顶部图表纵轴倒置,标注“越低越好”但视觉上越高越好,造成混淆。
- 关键引用:"The chart at the top is somewhat confusing. It says, 'lower is better' but the y-axis is inverted!"(评论2)
其他观点:评论1认为该问题天然适合
/goal效果;评论4调侃AI与CSS修复的对比;评论8建议使用Gurobi求解器获取最优解;评论10表示对项目有帮助。
平衡性说明: 评论对/goal指令持积极态度(评论3、7),但对评估方法和AI在复杂任务中的表现提出质疑(评论5、9),同时指出图表设计问题(评论2)。整体呈现支持与批评并存的平衡视角。