Hacker News 中文摘要

RSS订阅

当智能成本下降100倍时会发生什么 -- What Happens When the Cost of Intelligence Drops 100x

文章摘要

当人工智能成本下降100倍时,进步不仅体现在顶尖模型的能力突破上,更在于低成本使大量重复性任务变得可行。选择模型时需权衡能力与成本,而成本下降将解锁海量应用场景。

文章总结

智能成本下降100倍意味着什么?

大型语言模型的进步通常体现在“天花板”的提升——即最先进模型能完成以前无法完成的任务。但另一个常被忽视的方向是“地板”的下降:以多低的成本可以获得特定水平的智能。许多实用任务不需要最聪明的模型,而是需要足够好的模型被大规模应用,例如阅读某一主题的所有科学论文、检查档案中的每份合同、或总结大型论坛的所有帖子。这类任务的关键不在于模型能否完成,而在于能否在预算内完成一万次。

选择模型时,需要在能力与每次调用的成本之间权衡。作者最近关注到“地板”成本的变化:他们测量DANDI档案库中数据集被后续论文重复使用的情况,需要阅读约一万篇候选论文。按当前价格,用春季时处于前沿水平的模型完成一次全量分析只需一百多美元;而今年三月,同等能力的成本要几千美元;一年前,这种能力甚至无法用任何价格获得。这种成本变化将分析从“抽样可行”变成了“全面可行”。

根据Artificial Analysis的数据,智能指数与每任务成本的关系揭示了帕累托前沿的移动:今年二月每任务成本1.22美元的智能水平,如今只需0.022美元,不到六个月下降了56倍,且下降速度在加快。按当前速度,特定能力水平成本下降100倍大约需要一年。问题不在于是否会发生,而在于它会改变什么。

前沿的移动

帕累托前沿持续向左上方移动:同等成本下获得更高智能,或同等智能花费更少。2025年下半年前沿缓慢推进,但2026年2月、4月、6月和8月的前沿几乎完全被新模型取代。天花板从2025年8月的智能指数35.3(GPT-5,每任务0.26美元)升至2026年8月的63.1(Claude Opus 5,每任务2.34美元),一年内上升28点。同时,廉价模型的智能也在提升:GPT-5.6 Luna系列现在几乎占据了指数52以下的所有区间,2025年8月的天花板水平如今每任务仅需0.0088美元。

成本记录的变化

每个能力层级都遵循相似的轨迹:首先由大型前沿模型以高价实现,随后更便宜的模型(蒸馏模型或开源模型)迅速将成本降低一个数量级或更多。例如,指数≥40的层级在2026年2月首次由Claude Sonnet 4.6以1.22美元/任务实现,如今GPT-5.6 Luna以0.022美元/任务持有记录,成本下降56倍。指数≥50的层级在五个月内成本下降35倍。指数≥60的顶级层级目前仍维持高价(最便宜的Grok 4.6为0.84美元/任务),但按规律,蒸馏模型应在几个季度内将价格压至十分之一以下。

两个方向的进步

天花板提升改变了“可能”的边界——去年无法完成的任务现在可以完成。地板下降改变了“可规模化”的成本——原本能完成但无法大规模应用的任务现在变得可行。作者进行的文献扫描就是地板问题:模型只需阅读论文并回答明确问题,但需要处理所有候选论文。每篇论文成本从1美元降到0.02美元,意味着从试点研究变为全面普查。法律发现、系统综述、大规模数据整理、内容审核、客户支持分类等任务都具有相同特征,它们每几个月就会因成本下降一个数量级而变得可行。

更便宜的智能意味着更多投入

直观上,智能成本下降应导致支出减少,但实际情况相反。这符合杰文斯悖论:更高效的蒸汽机减少了单位工作的煤炭消耗,却因工作变得便宜而催生更多用途,最终增加了总煤炭消耗。当智能单位成本下降30倍时,原本就在做的工作变得更便宜,但更大的效应是那些因成本过高而从未尝试的工作现在变得可行。作者的文献扫描项目就是例子:去年成本下可能只做一次抽样分析,今年则对整个语料库运行,并在流程变化时重复,甚至计划对每个阳性结果运行三次以降低噪声。每篇论文成本下降了一个数量级以上,但项目总支出反而增加了。只要需求对价格高度弹性,前沿下降就意味着更多token被消耗,而非更少支出。

100倍变化意味着什么

如果过去一年的速度持续,2026年初每任务1美元的能力到年底将降至1美分,而当前每任务几美元的顶级模型将在几个季度内降至十分之一以下。这将带来几个直接后果:

  • 阅读一切成为默认:每份文档1美分时,模型可以例行阅读某个领域的所有论文、档案中的所有记录、所有邮件或所有支持消息。问题从“看哪些文档”变为“对所有文档问什么问题”。
  • 多轮工作流成为常态:运行三次任务并取共识的成本低于几个月前运行一次的成本,且能大幅提高准确性。
  • 能力层级不再有意义:系统会根据需要自动路由到不同智能水平的模型,稀缺资源不再是智能本身,而是判断该用智能做什么、用于验证的基准真相、以及大规模运行的系统。这些部分不会变得更便宜。

评论总结

根据评论内容,总结主要观点如下:

1. 成本下降趋势显著,但存在争议 - 多数评论认可AI推理成本正在快速下降,预计可达50-500倍(评论3、5)。作者bkd9指出,图表展示了达到固定能力水平的最便宜方式随时间变化(评论1)。 - 但评论17强调“质量与价格”的权衡:便宜模型可能无法胜任复杂任务(如代码维护),且速度慢会抵消成本优势。

2. 对“智能”本质的质疑 - 评论7认为LLM只是“高级搜索引擎”,降低的是数据获取成本而非智能成本,工程师的智能仍不可替代。 - 评论19直言“这不是智能”,用户仍需费力引导模型(如要求Claude减少冗长输出)。

3. 应用场景与瓶颈 - 机器人领域:评论2指出处理速度是主要瓶颈(如折叠衣物需10分钟/件)。 - 小模型优势:评论6、13指出,对许多任务小模型已足够,且更快更便宜;评论11提到中国开源模型性价比极高。 - 速度比成本更重要:评论14认为响应速度是更大瓶颈,即使“钱不是问题”的项目也受限于LLM速度。

4. 杰文斯悖论与需求弹性 - 评论9、15引用杰文斯悖论:效率提升可能导致总消耗增加(如拉斯维加斯LED灯反而增加照明量)。评论15认为软件和智能的需求可能无限,因此token消耗将持续增长。

5. 经济影响与风险 - 评论20警告:美国经济依赖高价显卡,成本下降100倍可能导致经济崩溃。 - 评论18指出,当前推理成本被严重补贴,真实成本尚不明确。

6. 对自主代理的乐观预期 - 评论8认为成本下降将极大推动自主代理部署,降低“让代理自由运行”的经济门槛。

关键引用(保留中英文): - “There’s still 50-500x cost reduction... from specialized chips + improved distillation”(评论3) - “I think speed is actually going to be a bigger factor than cost”(评论14) - “Jevons Paradox... when efficiency gains lead to rise in total consumption”(评论9) - “this shit is not 'intelligence'”(评论19)