Hacker News 中文摘要

RSS订阅

我烧光了所有代币,只为研究如何节省代币 -- I burned all my tokens researching how to save tokens

文章摘要

作者在研究中因AI代理消耗大量token而失败,随后优化了自建深度研究流程,仅用已有订阅解决了成本和信任问题,并分享了可复现的方法。

文章总结

好的,这是根据您的要求,对原文进行的中文重述,保留了核心细节,并删减了与主题无关的冗余内容。


标题:我烧光了所有Token,只为研究如何节省Token

核心问题: 作者在Quesma公司研究AI Agent的经济性,特别是编码成本。他搭建了一个深度研究流程,但第一版在30分钟内就烧光了他Claude Max 5x计划的全部额度,且未产出任何结果。

解决方案: 作者利用自己已付费的三个订阅服务(Claude, Codex, Antigravity),通过共享内存插件(claude-mem)将它们整合,实现了“不额外花钱,Token量翻三倍”的效果。

核心策略:

  1. 模型分工,各司其职: 作者发现并非所有任务都需要最贵的模型。他设计了一个模型编排模式,为不同角色分配不同模型:

    • 搜索(Find): Claude Sonnet 5(性价比高,适合批量搜索)
    • 验证(Verify): Claude Opus 4.8(准确性最高,负责核查)
    • 规划与裁决(Judge & Plan): Claude Fable 5(最贵,仅用于规划、分解任务和解决争议)
    • 小任务(Small stuff): Claude Haiku 4.5(便宜快速,用于提取和格式化)
    • 执行工具(Run tools): Codex (GPT-5.5)(终端任务能力强)
    • 第二意见(Second opinion): Antigravity (Gemini 3.1 Pro)(不同模型家族,避免盲点)
  2. 关键技巧: 通过一个简单的Bash脚本,让Claude Agent可以调用Codex和Antigravity作为“无头子代理”。这样,这些子代理消耗的是它们各自订阅的Token,而非Claude的,从而大幅延长了研究时间。当某个订阅达到限额时,系统会自动回退到Claude模型,确保研究不中断。

  3. 减少幻觉,建立信任: 作者制定了严格的验证规则:

    • 发现者与验证者分离,由不同模型核查链接、引用和数字。
    • 所有发现必须附带URL和原文引用才能入库。
    • 绝不陈述源页面不包含的数字。
    • 规则是动态调整的,每次发现新的错误类型,就将其加入提示词中。
  4. 调整/deep-research的使用顺序: 将最耗资源的/deep-research工具从第一步改为最后一步。先由廉价模型完成初步搜索和验证,再由/deep-research对已验证的发现进行深化、填补空白。这样,它的任务量大大减少,Token消耗也随之降低。

最终成果: 作者建立了一个可信的知识库(存放在Obsidian中),包含数百条经过验证的笔记,涵盖定价、工具、基准和实践。他强调,AI研究必须与人工验证相结合,因为AI可能会因规则缺陷而错误地排除重要项目(例如,一个56k星的开源项目曾因规则问题被误杀)。

几个令人惊讶的发现:

  • 工具链(Harness)的影响不亚于模型本身: 同一模型在不同工具链上,Token消耗可相差66倍,且更精简的工具链得分反而更高。
  • 上下文压缩(Compaction)可能适得其反: 压缩过程本身消耗Token,且可能因错误地移除Agent仍需的文件,导致反复读取和压缩,最终使Token消耗翻倍。
  • 中途修改工具会清空缓存: 在会话中增删或重排一个工具,会导致整个缓存前缀失效,后续请求按全价计费。
  • Token计数器不等于最终账单: 实际账单可能因上下文累积、重试、框架开销等因素,是简单估算的7-11倍。

总结建议: 在进行深度研究时,尝试颠倒顺序:用廉价模型搜索,用精确模型验证,最后再用深度研究工具。充分利用已有的多个订阅,为每个模型分配明确的角色,这比盲目使用一个顶级模型要高效得多。

评论总结

根据评论内容,总结主要观点如下:

1. 关于Token节省策略的反思 - 许多评论者认为,过度追求“节省Token”可能适得其反。例如,动态调整提示前缀会破坏缓存,反而增加成本(评论4:“most 'token saving' ideas are cache killers — anything that makes the prompt prefix dynamic ... can cost more than the tokens it saves”)。 - 有评论建议,在对话早期固定检索选择,支付稍大的固定前缀,比任何自适应方案更有效(评论4:“Freezing the retrieval selection early in a conversation and paying a slightly larger fixed prefix beat every clever adaptive scheme”)。

2. 模型选择与分层使用 - 多位评论者强调,使用分层模型策略(先用廉价模型探索,再用强大模型精炼)是节省Token的关键(评论3:“The best way to save tokens is to start out the deep research pass with cheap models and then funnel the findings through increasingly powerful models”)。 - 也有评论指出,本地模型与云端模型结合使用(如80/20或90/10规则)可大幅降低成本(评论8:“Could one not save a lot of money on tokens by using the 80/20 or 90/10 rule ... 90% of AI usage is on local models”)。

3. 对“无幻觉”声称的质疑 - 有评论者认为,文章声称“无幻觉”是不现实的,因为规则或其他模型无法从根本上解决幻觉问题(评论14:“TFA says 'no hallucinations' but you can't fix hallucinations with rules or other models”)。

4. 避免供应商锁定与投资本地模型 - 评论者建议,通过评估(evals)避免供应商锁定,并投资本地模型以增加控制力(评论15:“part of the economics is avoiding vendor lock-in with evals ... and increasing control by investing in local models”)。 - 有评论者分享经验,使用云端LLM帮助本地模型找到“足够好的配置”,以保持灵活性(评论15:“You can use Big/Cloud LLMs to help you 'find good enough configs' for your local/small llms”)。

5. 对AI行业生态的讽刺 - 有评论者讽刺云AI提供商通过写博客文章来推广自身效率,但实际产品尚未交付(评论6:“cloud AI providers have convinced people that cloud AI is worth it because of all the ways people have been able to use cloud AI to write blog posts about using cloud AI to make cloud AI more efficient”)。

6. 其他实用技巧 - 有评论者建议,让AI代理定期分析历史对话,更新规则和技能,避免重复步骤(评论9:“ask your agent at times to analyze last chats and update rules and skills to not repeat the same steps”)。 - 也有评论者提到,使用内置技能和代理不如仅依赖模型本身更节省Token(评论7:“I stopped using any of the built-in skills and skills agents ... that seems to work better for token usage”)。