Hacker News 中文摘要

RSS订阅

Schema Harness 在 Arc‑AGI‑3 公开测试中达到约 99% 的准确率 -- Schema Harness Achieves ~99% on Arc‑AGI‑3 Public

文章摘要

前沿模型在ARC-AGI-3测试中取得突破,通过物理学家式的探索方法,在无规则说明的64×64网格环境中自主建模并行动。官方指标RHAE显示,模型性能从3月发布时的0.51%提升至7月GPT-5.6 Sol的7.78%,公共集达13.33%,但仍远低于人类基准。

文章总结

好的,作为一名专业的中文编辑,我将对您提供的英文文章进行中文重述,保留核心细节,并删减与主题无关的内容。


文章核心内容重述

标题: 使用我们的“Schema”框架,前沿模型在ARC-AGI-3公开集上达到约99%的准确率

核心结论: 我们发布了一个名为“Schema”的新框架。它不改变模型本身的权重,而是改变了模型使用方式——即如何将观察转化为对游戏世界的可工作模型,如何用交互历史检验预测,以及如何执行和修正计划。通过这种方式,使用Claude Opus 4.8和Fable 5模型,Schema在ARC-AGI-3公开测试集上达到了98.98% 的分数;使用GPT-5.6 Sol模型则达到了95.35%。这证明了如何使用模型比模型本身更重要

背景与挑战: ARC-AGI-3是一个极具挑战性的基准测试。它给AI一个游戏环境,但AI只能看到64x64的彩色网格和合法动作,没有目标、规则或奖励说明。AI必须像物理学家一样,在行动中不断构建和修正对世界的假设。官方指标RHAE(相对人类行动效率)比较了AI与人类首次接触游戏时的行动效率。此前,最先进模型在该测试上的公开集得分仅为13.33%。

Schema的核心思想: Schema将世界的内在表示视为一个可执行的程序,而非一个向量。这使得世界模型具有三大优势: 1. 可解释性:是一个可读、可比较的文本文件。 2. 可验证性:可以回放并与真实记录进行逐帧对比。 3. 可搜索性:程序本身就是一个模拟器,可以在其中进行免费的规划。

Schema的工作流程: 它像一个物理学家一样思考,将问题分解为两个层面,并联合解决: 1. 状态基础化:将原始像素转化为可追踪的对象、变量和关系。 2. 机制发现:找出在某个动作下状态如何变化,并将其编写为可执行的程序。

当预测与观察不符时,Schema可以同时修正“状态表示”或“转换规则”,就像爱因斯坦修正“以太”概念一样。

关键发现与证据:

  1. 诱导出的世界程序使行动更高效:在25个游戏中的14个,当AI诱导出一个能精确复现其历史记录的世界模型后,其行动效率是人类参考值的1.6到5.0倍。原因在于,AI只需在真实环境中支付一次“发现成本”,之后便可在模型内部进行免费的规划(如广度优先搜索),避免了反复试错。例如,在M0R0游戏的第四关,AI仅用42步就完成了人类需要500步才能完成的任务。

  2. Fable模型通过更优的实验决策找到正确模型:在相同框架下,Fable 5模型比Opus 4.8模型表现更好。关键区别在于,Fable在预测失败后,更倾向于质疑当前的“状态表示”本身,并设计出能区分不同假设的关键实验。而Opus则倾向于在现有表示框架内进行更多尝试。例如,在DC22游戏中,Fable通过一次关键实验发现了“传送门”机制,而Opus则因模型缺失该机制而无法通关。

总结: * Schema框架降低了“使用一个理论”的成本,使其可持久化、可精确验证、可搜索。 * 底层模型决定了“发现一个有用理论”的成本。Fable模型在做出关键性表示修正方面更为高效。

展望: ARC-AGI-3上的98.98%得分并非终点,而是一个新的起点。它标志着“机制发现”作为一种通用能力的出现——通过行动和感知的循环,在远比64x64网格更丰富的环境中,去理解世界的因果结构。这正是我们未来的研究方向。

评论总结

以下是对评论内容的总结,关注主要观点、论据、认可度(评分均为None,故不单独标注),并保持不同观点的平衡性。每条观点保留2-3条关键引用(中英文)。


1. 对ARC-AGI-3高分的认可与质疑

  • 认可:部分评论认为结果令人印象深刻,可能代表突破。
    • “Impressive results. Will this translate to coding agents too?” (westurner)
    • “If this holds then it might represent a breakthrough in other domains as well.” (causal)
  • 质疑:多数评论指出缺乏私有测试集验证,且方法可能依赖特定“harness”而非通用智能。
    • “We need to see private set results.” (levocardia)
    • “Big jump for sure, but definitely comes with a giant grain of salt lacking open-sourcing the harness itself.” (gandalfgeek)
    • “It’s not as impressive as it looks… the harness is measuring something entirely different.” (teravor)

2. 对“Harness”方法的讨论

  • 正面:认为“harness”是解决接口问题的关键,模型本身已足够智能。
    • “If such smart models fail so hard on simple games, the interface is the problem, not the model. Right harness provides a good interface.” (scotty79)
    • “Harness matters immensely… if this can be RLed in as another native capacity, that will be interesting.” (vessenes)
  • 负面:批评该方法类似“pass@n”取最高分,缺乏实质意义。
    • “This is like pass@n until you get the high watermark? How would this mean anything?” (ubermon)
    • “What this harness does is get the model to write a simulator first… it’s measuring something entirely different.” (teravor)

3. 对通用性与泛化能力的怀疑

  • 评论者担心该方法是否仅针对特定游戏(如ARC-AGI-3)硬编码先验,而非真正泛化。
    • “Does this approach generalize to, e.g., Atari or NES games, or is it just hard-coding priors?” (levocardia)
    • “In the spirit of ARC-AGI-3-like challenges, we tested Baba Is You… models beat first two stages, but Gemini struggles.” (stared)

4. 对透明度与开源的要求

  • 多位评论者要求公开代码和私有测试集结果,以验证真实性。
    • “Where’s the code?” (nkmnz)
    • “Can someone tell me what the catch is? Surely the ARC Foundation would have tested this against the private data set?” (daytonellwanger)
    • “I can’t tell if the authors intend to submit this to ARC-AGI for a verified score.” (netinstructions)

5. 对写作风格与意义的批评

  • 部分评论认为文章质量差,缺乏清晰解释。
    • “God, who the fuck are they even writing this slop for? Other machines? Absolutely garbage write up.” (nathan_compton)
  • 也有评论从历史角度反思:规则方法可能因人类效率低而失败,但LLM可弥补。
    • “When humans tried rule-based approaches, we failed because we couldn’t type rules fast enough. But LLMs never tire… could we make a frontier GOFAI agent?” (markisus)

总结:评论者对ARC-AGI-3高分结果持谨慎乐观态度,普遍要求私有测试集验证和代码开源。核心争议在于“harness”方法是否真正代表通用智能突破,还是仅针对特定任务优化。部分评论认可其工程价值,但质疑其泛化能力和意义。