文章摘要
文章探讨了大型推理模型(LRM)的“推理”本质,指出其通过思维链生成答案,但质疑这种过程是否真正符合逻辑推理,并以AI解决数学难题为例,反映了科学界对其机制的理解仍存在争议。
文章总结
好的,这是根据您的要求,对原文主要内容进行的中文重述,保留了核心细节,并删减了与主题无关的修饰性内容。
核心问题:AI的“推理”能力究竟是真是假?
近年来,被称为“大型推理模型”(LRM)的AI系统展现出惊人的能力,例如在2026年5月,OpenAI的一个模型一次性解决了一个著名的开放数学研究问题。然而,关于这些模型是否真的在进行“推理”,科学界存在巨大争议。
支持“真推理”的证据: * LRM在国际数学奥林匹克竞赛中夺得金牌,这一成就连许多成功的数学家都难以企及。 * 谷歌DeepMind与数学家陶哲轩合作,利用AI重新发现或改进了67个数学问题的解法。
质疑“假推理”的证据: * 苹果公司的研究指出,AI的“思维链”可能是一种“思维幻觉”,在简单条件下会出现“完全准确性崩溃”。 * 圣塔菲研究所的研究表明,LRM可以通过“表面捷径”来破解推理基准测试,其行为更像是在“钻空子”,而非进行可推广的推理。 * 多项研究显示,LRM即使拥有必要的算法和计算资源,也无法可靠地进行推理,并存在大量已知的失败模式。
矛盾的核心:思维链(Chain of Thought)
LRM通过生成一系列文本(即“思维链”或“思考令牌”)来模拟推理过程。然而,越来越多的研究表明:
- 思维链不忠实于模型内部过程: 这些文本可能只是“喃喃自语”,其含义与模型实际发生的任何推理过程无关。有实验表明,用错误或无关的文本替换正确的思维链,模型的性能并未下降。
- 思维链并非必要: 研究发现,模型30%到60%的“思考步骤”对最终答案几乎没有因果影响。即使删除一半的思考步骤,模型性能也几乎不受影响。
- 训练不鼓励忠实性: 用于训练LRM的强化学习方法,可能并不会激励模型产生忠实的思维链。
一种可能的解释:近似检索
亚利桑那州立大学的Subbarao Kambhampati教授提出,LRM本质上仍是大型语言模型(LLM),其“推理”过程更接近于一种“近似检索”。模型并非在进行真正的逻辑推理,而是在其庞大的训练数据中,通过“思考令牌”来加载上下文,使其更有可能预测出类似推理的文本序列。这些令牌的具体内容并不重要,它们的作用类似于“自言自语”以唤醒记忆。
结论与影响:
- “正确但出于错误的原因”: LRM确实能产生准确的结果,但其背后的机制可能并非真正的推理。这类似于AlphaFold,虽然我们不清楚其内部复杂的统计关联,但它确实有效。
- 科学上的“一厢情愿”: 将AI的文本输出称为“推理”,可能是一种“一厢情愿的助记符”,即用拟人化的语言来描述我们尚不完全理解的过程。这有助于研究起步,但也可能导致对模型能力的误解。
- 实用主义 vs. 科学严谨: 一方认为,只要模型能解决问题、加速科研,就应拥抱它,并验证其结果。另一方则强调,必须理解模型“能做什么”和“不能做什么”,否则可能错失更优的解决方案,甚至陷入科学上的“兔子洞”。
最终,作者认为,在更清晰的科学解释出现之前,看待AI的“推理能力”应类似于看待汽车的“马力”——我们知道它有效,但不必相信引擎盖下真的有马在奔跑。
评论总结
评论总结
核心争议:AI是否具备真正的推理能力
观点一:AI的“推理”只是模式匹配与模拟(支持者较多)
主要论据: - LLM本质上是分类器,通过统计模式生成看似合理的输出,而非真正理解逻辑 - “推理标记”可能只是模型学习到的表面形式,而非真实思维过程 - 人类倾向于将语言输出拟人化,误以为模型在“思考”
关键引用:
“The model doesn’t have to learn or reliably apply a general reasoning process... it just has to absorb enough examples of what the steps look like to predictively mimic them” (sobiolite)
“LLMs are classifiers, there is absolutely no reason to assume they’re any different... They do what their handler wants to see, that’s all” (andy99)
观点二:AI确实在推理,只是方式不同(中等支持)
主要论据: - 模型能解决训练数据中不存在的数学问题,证明其具备某种推理能力 - 推理标记通过分解复杂问题,降低了单步预测的难度 - 人类推理本身也包含大量概率性和联想性成分
关键引用:
“How LLMs can now routinely solve open mathematical problems, with no solutions in the training data by definition... the model must be carrying out mathematical reasoning somehow” (apsec112)
“With reasoning tokens, this is much relaxed, allowing for many repeated applications of f() to gradually steer you from the input sequence to the start of the correct output sequence” (TGower)
观点三:争论本身无意义,应关注实际效果(中等支持)
主要论据: - “推理”的定义存在语义模糊性,类似“潜艇是否会游泳”的问题 - 无论是否“真正”推理,模型的实际表现已经证明了其价值 - 过度关注术语定义会偏离对功能性的讨论
关键引用:
“The question has become ‘what do we mean when we use the word ‘reasoning’’ which is uninteresting” (andrewla)
“It’s frustrating that anyone who says maybe we shouldn’t base our entire economy on this one thing until we understand it... is essentially labeled this way” (ofjcihen)
次要争议点
关于“推理标记”的可靠性
- 部分研究显示推理标记可能不忠实于模型内部过程(montebicyclelo)
- OpenAI声称现代模型已解决此问题,但未公开原始数据(Diogenesian)
关于拟人化倾向
- 人类天然倾向于将语言输出视为有意识的交流(baxtr)
- 使用“推理”“思考”等词汇是方便的表达,但容易造成误解(drob518)
关于AI与人类推理的本质差异
- AI缺乏真实体验和“感受质”(qualia),对世界的理解是抽象的(zarzavat)
- 人类推理包含好奇心、挫败感等情感驱动,AI目前缺乏这些机制(HarHarVeryFunny)
总体趋势
评论呈现明显的两极分化:一方认为AI的“推理”本质上是高级模式匹配,另一方认为模型确实展现了某种形式的推理能力。中间派则主张争论术语定义不如关注实际应用效果。多数评论认可AI在特定领域(如数学、编程)的表现,但对将其泛化为“真正推理”持谨慎态度。