Hacker News 中文摘要

RSS订阅

Kimi K3,以及我们仍能从鹈鹕基准测试中学到什么 -- Kimi K3, and what we can still learn from the pelican benchmark

文章摘要

中国AI实验室Moonshot AI发布2.8万亿参数的Kimi K3模型,自称首个“开源3T级模型”,在多项基准测试中超越Claude Opus 4.8和GPT-5.5,但不及Claude Fable 5和GPT-5.6 Sol。其任务成本与GPT-5.6 Sol相近,约为Opus 4.8的一半。

文章总结

中国AI实验室Moonshot AI于2026年7月16日发布Kimi K3模型,宣称其拥有2.8万亿参数,是公司迄今最强大的模型,并承诺于7月27日开源权重。该模型自称首个“开源3T级模型”(将2.8万亿四舍五入为3万亿),超越DeepSeek的1.6T v4 Pro。根据自测基准,K3在多数指标上优于Claude Opus 4.8 max和GPT-5.5 high,但逊于Claude Fable 5和GPT-5.6 Sol。

Artificial Analysis报告亮点: - 在长期知识工作评估中,K3的Elo评分达1547,较K2.6提升732分,仅次于Claude Fable 5。 - 单任务成本(0.94美元)与GPT-5.6 Sol(1.04美元)相近,约为Opus 4.8(1.80美元)的一半,但高于其他开源模型。 - 输出令牌使用量较K2.6减少21%。

定价方面,K3输入令牌每百万3美元,输出每百万15美元,与Anthropic的Claude Sonnet系列持平,成为中国AI实验室最昂贵的模型,较K2.6(0.95/4美元)大幅上涨。

作者通过OpenRouter调用K3生成“骑自行车的鹈鹕”SVG,消耗95个输入令牌和16,658个输出令牌(含13,241个推理令牌),成本25美分。模型对生成图像的描述准确,但暴露出以下特点: 1. 仅支持“最大”推理模式,消耗大量推理令牌。 2. 输入令牌计数异常(95个),暗示可能存在85个令牌的隐藏系统提示。 3. 视觉能力表现良好。

作者指出,鹈鹕测试虽已失去早期与模型性能的强相关性,但仍具实用价值:作为模型测试的“Hello World”练习、估算简单任务的成本与推理能力、验证模型输出有效SVG及空间认知能力(尤其对小型模型)、比较同系列模型迭代效果,以及作为分享测试体验的社交惯例。

评论总结

以下是对评论内容的总结,关注主要观点、论据及认可度(评分均为None,故不单独标注),并保持不同观点的平衡性:


1. 模型评估方法的争议

  • 支持“鹈鹕测试”作为非传统基准:评论认为,使用随机、无意义的提示(如“鹈鹕骑自行车”)能有效避免模型对训练数据的过拟合,并揭示模型的真实能力。

    • 关键引用
      • “The idea is not to use pelicans on bikes but a similarly random non-sensical prompts... pick another one for next cross-llm evaluation.” (rdtsc)
      • “It will be valuable to have two types of benchmarks: ones that evolve alongside the models and ones that never change.” (spikk)
  • 质疑“鹈鹕测试”的可靠性:部分评论指出,这类提示可能已存在于训练集中,且模型输出结果可能因随机性而波动,单次测试不足以代表模型水平。

    • 关键引用
      • “I would be surprised if pelican svgs are not part of the training corpus rn.” (Xxcrazy420xX)
      • “Run the same model a few times and you get some different pelicans... the gap between runs is about as big as the gap between the models.” (yashchimata)

2. 成本与性能的权衡

  • Kimi K3的性价比优势:Kimi K3在成本上显著低于其他前沿模型(如Opus、Fable),但速度较慢,且在某些任务上表现接近。

    • 关键引用
      • “Kimi is cheapest by 5x but also slowest by 2x.” (michaelbuckbee)
      • “The gap is closing. I think Kimi 3 is only 3 months behind the US model.” (bcit-cst)
  • 对成本评估的批评:有评论认为,工程师常低估人类完成相同任务的成本,而模型的高成本在对比人类劳动时可能并不昂贵。

    • 关键引用
      • “Engineers get unbelievably silly about evaluating costs of things... how much would even the least capable human effort cost?” (BugsJustFindMe)

3. 模型能力的局限性

  • 缺乏“品味”与创造力:部分模型(如Sol)虽能完成任务,但输出缺乏审美和叙事逻辑,而Fable在复杂动画生成上表现更优。

    • 关键引用
      • “Sol feels the most ‘gets stuff done’ but has zero taste, or any capability to surprise.” (mesmertech)
      • “Fable is still the top one... Sol did something similar but you can instantly tell its AI slop.” (mesmertech)
  • 视觉反馈与自我修正能力不足:模型在生成SVG后,无法通过视觉反馈进行自我优化,这限制了其输出质量。

    • 关键引用
      • “Do any of the vision models render the SVG and look at the result... relating something it sees to something it wrote is not an ability it is very good at.” (Lerc)

4. 中美模型竞争与资源差异

  • 中国模型的追赶速度:尽管美国在算力上占优,但中国实验室(如Kimi)通过高效训练策略,在参数规模与性能上快速逼近。

    • 关键引用
      • “If the U.S. compute advantage is persistent, it’s hard to imagine that Chinese labs will be able to keep pace forever... but so far they seem to be doing just fine.” (tibbar)
      • “3T is impressive, but parameter count seems to be less important than I thought... it seems to be the attention mechanism.” (andai)
  • 对Kimi的负面评价:部分评论批评Kimi的品牌策略(使用古典音乐命名)及对中国数据主权的担忧。

    • 关键引用
      • “Kimi is right out since they use classical music branding to sell their slop... Why does Kimi not use a ‘Double Cheese Whammy’ branding?” (Zsfe510asG)

5. 测试方法的改进建议

  • 多轮测试与动态基准:建议对同一模型进行多次测试以消除随机性,并建立随时间演化的基准集。
    • 关键引用
      • “Would love to see 8 runs per model side by side.” (yashchimata)
      • “You probably can’t get historical stability and resistance to flooding and training on at least some parts of it from the same test.” (spikk)

总结

评论围绕“鹈鹕测试”的合理性、模型成本与性能的平衡、中美竞争态势及测试方法改进展开。支持者认为随机提示能避免过拟合,反对者则质疑其代表性和可靠性。Kimi K3在成本上优势明显,但速度与创造力仍有不足。整体上,评论呼吁更严谨、动态的评估体系,并关注模型在真实任务中的“品味”与自我修正能力。