文章摘要
我们使用18个前沿模型进行了153次自主运行,测试了nanoGPT优化器的速度表现,并记录了各模型的最佳验证结果与运行轨迹。
文章总结
我们针对18个前沿模型,在nanoGPT优化器速度挑战中进行了153次自主运行实验。实验记录了各模型的最佳验证结果,并提供了按时间或令牌数变化的性能曲线。所有模型均可折叠查看,并支持按模型筛选。排名靠前的模型包括:Fable 5(记录2,726,差距闭合81.7%)、Opus 5(2,920,53.6%)、Kimi K3(2,930,52.2%)等。每个模型都列出了其使用的工具、最高记录、24小时性能、总令牌数、输出令牌数、实验次数、调用次数和运行天数。此外,还提供了等预算比较功能,即在相同资源预算下比较各模型的最佳最终运行结果,预算选项包括6小时、24小时和9天。所有支持的模型、工具和种子组合共41种,均可查看完整轨迹,包括工具调用、子代理和草稿板。
评论总结
根据评论内容,总结主要观点如下:
1. 实验设计与方法论争议(高认可度) - 评论者质疑实验的公平性和可比性,指出不同模型在“努力程度”(effort setting)上不一致,如Fable 5用“高”而Opus 5用“最大”,可能影响结果。 - 关键引用:“why was Fable 5 tested on high while Opus 5 was tested on max?”(ninjahawk1) - 另有评论指出Sol模型因等待时间过长导致时间轴失真,且部分运行使用了旧版程序文件,并非完全对等比较。 - 关键引用:“the graphs aren't complete apples-to-apples comparisons”(nsingh2)
2. 模型表现与成本分析(中等认可度) - 多数评论关注模型性价比,如GPT-5.6 Luna被赞“便宜且达到Sonnet级别性能”,而Grok表现不佳引发对其模型或框架缺陷的讨论。 - 关键引用:“Such a cheap model, and Sonnet levels of performance”(nl) - 有评论建议增加“美元成本”作为第三轴,认为时间受推理基础设施影响,而token在不同模型间不等价。 - 关键引用:“Time is sometimes more about inference infrastructure... than model quality”(espadrine)
3. 创新性不足与AGI前景(中等认可度) - 多位评论者注意到模型缺乏真正的新颖性,尽管能深入理解对象,但“几乎没有真正的新想法出现”。 - 关键引用:“very few genuinely new ideas emerge... That was disappointing. I guess 2026 will not be the year of AGI.”(throwa356262) - 另有评论探讨“弱信号保留”问题,认为实验框架可能影响结果,并质疑是否应调整目标提示以鼓励创新。 - 关键引用:“Curious if a harness that helped preserve signals... would change the outcome”(vibe42)
4. 数据污染与解释边界(低认可度但具建设性) - METR合作者指出,若模型从原始基线开始运行,可能存在数据污染风险,且部分模型未达到性能平台期,结果不应视为能力上限。 - 关键引用:“we shouldn't treat these results as a full upper-bound on capabilities”(narush) - 该评论还提出“支出视界”(expenditure horizon)作为替代评估方法,以成本而非时间作为基准。
5. 其他观察(低认可度) - 人类得分是整数引发质疑(bee_rider),以及Grok 4.6运行结果值得关注(logicallee)。 - 有评论认为开源模型已能挑战万亿级SOTA模型,预示未来竞争格局变化(henry2023)。