文章摘要
仅凭每百万token的价格比较AI模型成本是误导性的,因为不同实验室的tokenizer差异巨大,同一文本在不同模型中的token数量可能相差30%以上,且token效率存在极端差异,导致实际成本无法直接对比。
文章总结
标题:每百万Token定价毫无意义
当API账单袭来时,AI就不再只是“感觉不错”的事了。许多公司如今发现,AI确实可能价格不菲。一个可能推高AI账单的习惯,就是按“每百万Token X美元”来比较模型。数字越低意味着成本越低,对吧?其实不然。
每百万Token定价无法直接比较
每个前沿实验室都有自己的分词器,这决定了同一段文本会被拆分成多少Token。例如,本文到目前为止的所有内容,在gpt-4o中会被拆分为160个Token,但在gpt-4(1106-preview)中,同样的输入却要花费200个Token。即便在同一家前沿实验室(比如OpenAI),按Token计价的模型价格也无法直接比较。在不同实验室之间比较数字,尤其是当它们不断调整专有分词器时,会引入难以可靠衡量的误差。Anthropic最近修改了其分词器,导致Claude将同一段文本拆分成多出30%的Token。在其他条件不变的情况下,这相当于一次相当大幅度的涨价;然而,还有另一个重要因素需要考虑。
Token效率的极端差异
即使忽略分词器的影响,另一个重要因素是每个额外Token的实际价值。我指的不是Token的价格,而是你用它能实现多少效果。如果你用AI做正经工作,很可能大部分Token消耗都花在“思考”上——这通常是隐藏或模糊的,但按与可见输出Token相同的费率计费。这种技术能大幅提升输出质量,然而,所谓的“思维链”长度可能成为影响AI使用总成本的主要因素,而且这个长度变化极大。
我挑选了美国前沿实验室的一些最佳当前AI模型,以及中国实验室的顶级产品(这些产品常被宣传为与美国模型几乎一样好,但成本仅为1/x,x常大于10),并将它们列在下表中。我还包含了每个模型在Artificial Analysis基准测试中的得分,该测试给AI模型分配任务,其研究者的目标部分在于衡量模型能力,部分在于衡量每个完成任务的计费情况。
| 模型 | 每百万Token输入/输出价格(美元) | AA智能基准结果 | 每基准任务成本(美元) | | --- | --- | --- | --- | | Claude Fable 5 | 10 / 50 | 60 | 3.25 | | Claude Opus 4.8 max | 5 / 25 | 56 | 1.78 | | Claude Sonnet 5 max | 3 / 15 | 53 | 2.29 | | GPT-5.5 xhigh | 5 / 30 | 55 | 0.99 | | GLM-5.2 max | 1.40 / 4.40 | 51 | ~0.46 | | DeepSeek V4 Pro max | 0.435 / 0.87 | 44 | ~0.04–0.05 | | MiniMax-M3 | 0.30 / 1.20 | 44 | ~0.18 | | Kimi K2.6 | 0.95 / 4.00 | 43 | ~0.31 |
注意,尽管GPT-5.5名义上比Claude Opus 4.8更贵,但它在基准测试中每任务成本却几乎是Anthropic模型的一半。GLM-5.2每Token价格远低于GPT(3.57倍/5.68倍)和Claude(3.57倍/6.82倍),但其每任务成本并未按比例降低,表明其Token效率低于西方前沿模型。
一个让我困惑的模型是Sonnet 5,因为它似乎性能不如Opus 4.8,同时由于Token效率低得多,每任务成本反而更高。如果有人使用它,能向我解释这个模型的目的,我将洗耳恭听。(阴谋论:也许这是Anthropic的一种心理战术,用较低的标价诱使人们使用Token效率更低的模型,最终推高他们的账单?)
DeepSeek V4 Pro似乎是成本效率最突出的异类。尽管它在智能基准测试中得分明显较低,但其每任务成本极低。Fable 5(带有安全限制的Mythos)相比GPT-5.5,改进幅度不大,但价格却上涨了3倍多。
总体而言,我认为这张表表明,每百万Token价格并非有意义的成本指标。如果你不考虑实际每任务成本,就会做出更差的模型选择决策,最终以更高的价格获得更差的性能。
评论总结
根据评论内容,主要围绕“每token成本”与“每任务成本”的实用性展开讨论,观点存在分歧。以下是总结:
1. 对“每token成本”的批评 - 评论认为该指标具有误导性,因为订阅价格与按token计费差异巨大(评论5:“Price per token is meaningless for more reasons than this, because all of the provider monthly subscriptions price tokens extremely differently than their per-token billing rates”)。 - 模型输出长度差异大,导致实际成本不可比(评论14:“Some models... were so verbose, that they generated many more tokens... So even though it had better generated tok/s, because so many more were generated, the clock time was longer”)。 - 工具调用、缓存效率等因素未被考虑(评论12:“tool use is another factor, every time the agent uses a tool the entire context is priced at cache rate on top”)。
2. 对“每任务成本”的认可与局限 - 部分评论认为“每任务成本”更有意义(评论3:“cost per benchmark task is definitely interesting!”;评论16:“the ‘cost per task’ he uses makes some sense”)。 - 但指出其局限性:任务难度不同时,低成本模型可能无法完成(评论6:“Cost per benchmark task is also meaningless if your task is difficult enough that the cheaper model has no chance of cracking it”)。
3. 其他关键因素 - 速度与用户体验:评论9强调“speed, especially in non-coding contexts that benchmark less cleanly”。 - 内部部署与成本不确定性:评论7建议企业自建GPU集群以控制成本,因为“the uncertainty over price is almost nothing compared to the uncertainty over the effective use of AI”。 - 订阅token成本差异:评论18指出“cost per benchmark task using subscription tokens... quite different from API costs”。
4. 平衡观点 - 评论19以燃料类比,认为每token成本并非无意义:“Cost per tokens is as valid as price per unit volume of fuel... That would be throwing away the only data point you have been using”。 - 评论17指出定价复杂性:“An LLM is an extremely complex thing... The hope that there would be some simple pricing construct that would map nicely to value provided is a pipe dream”。