Hacker News 中文摘要

RSS订阅

Anthropic似乎在Claude Code中A/B测试降低的努力水平 -- Anthropic appears to be A/B testing reduced effort levels in Claude Code

文章摘要

用户发现Anthropic在Claude Code 2.1.236+版本中悄悄进行A/B测试,将“高”努力值实际设为10/100(相当于以前的“低”),导致模型表现变差,且更新日志未说明,用户误以为自己的代码或应用出问题。

文章总结

更新:这是服务器端的问题,而非应用程序本身。Anthropic 将 Claude Code 2.1.236 及以上版本的 fable 5 会话纳入了一项实验,该实验缩小了努力程度的范围,而旧版本和 opus 5 则保持不变。这很可能是一个 A/B 测试,因此并非所有人都会看到这一变化。如果你觉得“高”努力程度感觉像“低”,那么你就属于测试组。天哪,Anthropic,你们有时真让人受不了。

如果本周 fable 感觉变笨了,那不是你的问题。自 2.1.237 版本起,模型将“高”努力程度解读为 100 分中的 10 分,这恰好是过去“低”努力程度对应的数值,而更新日志中对此只字未提。我花了整个下午的时间,确信是 t3 代码和我自己的应用程序出了问题,直到后来才发现真相。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 模型行为异常与成本问题(评分:无,多位用户支持)

    • 用户反映Opus 5在处理简单任务时过度消耗资源,如一个配置文件更新任务耗时43分钟,远超预期(评论3)。
    • 子代理在简单任务上消耗大量token(评论4)。
    • 用户认为模型“话多”导致成本增加,建议使用低推理模式(评论6)。
  2. 对Anthropic的信任危机(评分:无,多位用户支持)

    • 用户因模型表现差、客服无响应而取消订阅(评论15、17、20)。
    • 有用户转向OpenAI Codex或其他模型(评论9、10、13)。
    • 用户批评Anthropic“在建造一个人,而非工具”(评论15)。
  3. 计费模式不透明(评分:无,多位用户支持)

    • 用户质疑基于token的计费模式,认为应基于实际资源使用(评论11)。
    • 用户指出公司有动机通过注入提示、改变默认设置等方式增加消费(评论23)。
  4. 官方回应与争议(评分:无,来自Thariq的更新)

    • Anthropic官方解释称,测试中的API配置映射了不同的数值,但用户选择的努力级别是有效的,不影响性能(评论22)。
    • 部分用户对此不买账,认为模型行为存在明显退化(评论18、19)。

平衡性总结: - 支持方:官方声称测试配置不影响性能,用户选择的努力级别有效。 - 反对方:大量用户报告模型行为异常、成本激增、客服体验差,并质疑计费模式不透明。

关键引用(保留中英文): - “Opus 5 Result: 43 minutes of pulling containers, running sandboxes, creating testing suites...”(评论3) - “I’ve cancelled my Claude sub... I have no desire to engage with a non-human somehow managing to speak down to you”(评论15) - “We sometimes test API serving configs... the effort you selected is the effort you're getting”(评论22)