Hacker News 中文摘要

RSS订阅

GPT-5.5 Codex推理令牌聚类可能导致性能下降 -- GPT-5.5 Codex reasoning-token clustering may be leading to degraded performance

文章摘要

该文章指出,GPT-5.5 Codex在推理过程中出现token聚类现象(集中在516/1034/1552等位置),可能导致复杂任务性能下降。

文章总结

好的,这是根据您提供的英文内容,使用中文重新陈述的文章主要内容,已保留关键细节并删除了与主题无关的导航、界面元素和重复的评论。


文章标题: GPT-5.5 Codex 推理令牌在 516/1034/1552 处出现聚类,可能导致复杂任务性能下降

核心内容:

一位用户(vguptaa45)在 OpenAI Codex 的 GitHub 仓库提交了一个问题报告,指出在分析 Codex 的 token_count 元数据时,发现了一个异常模式:GPT-5.5 模型的响应中,其“推理输出令牌数”(reasoning_output_tokens)不成比例地集中在 516 这个精确数值上,同时在 1034 和 1552 处也有明显的峰值。

主要发现与证据:

  1. 模型特异性: 该问题主要影响 gpt-5.5 模型。在分析的约 39 万条响应记录中,gpt-5.5 仅占所有响应的 19.3%,但却占据了精确值为 516 事件的 82.0%。相比之下,其他模型(如 gpt-5.2gpt-5.4)的该比例极低。

  2. 时间趋势: 从 2026 年 2 月到 6 月,精确值为 516 的聚类现象急剧增加,从 2 月的 0.11% 飙升至 5 月的 53.30%。与此同时,整体的平均推理令牌数和 P90 推理令牌数却显著下降,表明模型在复杂任务上的推理强度在减弱。

  3. 数值特征: 这些固定数值(516, 1034, 1552)看起来像是重复的阈值边界,而非自然变化的推理令牌分布。后续有其他用户验证发现,这些数值构成了一个等差数列(516 + n*518),进一步支持了“量化推理预算”的假设。

问题分析与推测:

报告者认为,这种异常模式并非偶然。它表明 gpt-5.5 模型可能存在一个内部的推理预算、路由、截断或调度机制,导致其推理过程在达到 516、1034 或 1552 个令牌时被强制终止。这种“短回路”行为与模型在复杂、高风险任务上的性能下降有关。

用户反馈与验证:

该问题报告获得了大量用户的共鸣。许多用户通过分析自己的本地会话日志,独立验证了这一模式,并提供了类似的统计数据。一些用户还进行了具体任务的测试,发现当推理令牌数恰好为 516 时,模型给出的答案往往是错误的;而使用 gpt-5.4 模型或当推理令牌数远高于 516 时,则能得到正确答案。

核心诉求:

报告者要求 OpenAI Codex 团队调查 gpt-5.5 是否存在导致推理在 516/1034/1552 处终止的行为,并明确这些数值代表的是正常停止点、预算上限、降级服务还是其他内部阈值。

评论总结

根据评论内容,主要观点和论据总结如下:

观点一:GPT-5.5 Codex存在推理输出token聚类现象,导致性能下降 - 评论1指出,GPT-5.5的推理输出token在固定值(间隔518)处聚类,与复杂任务错误强相关,而此现象在GPT-5.4中较少,在5.2和5.3中几乎不存在。 - 评论6证实,使用Codex CLI时,模型有时仅用516个token思考并返回错误结果,而使用6000-8000个token时则正确,暗示自适应思考存在问题。

观点二:模型质量明显下降,用户转向替代方案 - 评论2表示,GPT-5.5 Codex的推理能力远不如前代,与Claude等模型相比智能差距显著。 - 评论4称,今年早些时候Codex的出色编码体验已消失,出现间歇性愚蠢实现,已转向Claude。 - 评论9提到,免费使用一个月后发现GPT-5.5表现奇怪/糟糕,改用OMP (Pi)后体验更好。

观点三:性能下降可能与成本优化有关 - 评论3推测,OpenAI可能将推理推理批处理为512 token的倍数以优化吞吐量。 - 评论5质疑,此前有人声称OpenAI通过突破性优化将计算成本减半,是否正是此现象。

观点四:历史重演,用户考虑混合方案 - 评论8指出,这与4月Claude Code的性能回归类似,当时用户转向Codex;现在考虑混合使用多个模型,如Fireworks上的GLM 5.2处理大多数任务,仅在必要时使用高端模型。

平衡性总结:多数评论认为GPT-5.5 Codex存在明显性能退化,尤其是推理能力下降,可能与成本优化导致的token聚类有关。用户已转向Claude、OMP或混合方案。但评论10提到,5.3版本在token使用和代码质量上最佳,5.5虽更好但消耗token过多。