文章摘要
当前AI模型在数学和代码基准测试中表现优异,参数效率大幅提升,但事实性知识召回能力严重下降。例如,Gemini 2.5 Pro在SimpleQA测试中仅达53%准确率,小型模型幻觉率高达80%以上,表明模型正为追求推理性能而牺牲基础事实准确性。
文章总结
模型正有意变“笨”:用知识换推理
近年来,推理模型的基准分数持续攀升,但每个token消耗的计算资源却在下降。例如,GLM-5.2在AIME 2026上达到99.2%的准确率,每token仅激活约400亿参数;Qwen3.5和DeepSeek V4-Flash的激活参数更少,性能却远超2023年时约2800亿参数的GPT-4。在小型模型中,Qwen3.5 9B量化后仅需6GB显存,其智能指数几乎是同参数级别最佳模型的两倍。仅看数学和代码基准,模型似乎在以惊人速度变得更聪明。
然而,当询问简单事实性问题时,情况截然相反。在SimpleQA基准测试中,当前领先的Gemini 2.5 Pro准确率仅53%,小型模型几乎无法回答。Qwen3.5 4B和9B在知识基准上的幻觉率高达80%至82%,意味着它们大部分时间都在编造答案。这种变化并非偶然——实验室正有意用世界知识换取推理能力。
参数原本用于存储知识。研究表明,每个参数约能存储2比特的事实知识。要模型记住大量细节,需要庞大的参数量。而推理能力压缩效率更高,因为它是一套可重复应用的流程(如分解问题、追踪中间状态、自我检查等)。通过蒸馏和强化学习,这些流程能很好地迁移到小模型中。Phi-4(140亿参数)擅长数学却不擅长常识问答,这正体现了其训练数据的特点——这种组合如今已成为设计目标。
知识会过时,推理不会。前沿模型的训练耗时数月、耗资数亿美元,但训练完成后,其中的事实知识便开始老化。API变更、价格波动、人事变动,都让模型中的知识迅速过时。而推理流程(如代数运算、问题分解)则不会过时。一个以推理为主、知识为辅的模型,其“知识截止日期”影响更小,因为当前世界状态本就不应存储在权重中。
外部工具承载知识。如果模型不存储知识,就需要其他系统来提供:检索知识库、调用工具、搜索网络等。例如,编程代理无需记忆依赖库的API,因为它会在运行时查阅文档或代码库。这种模式将原本每次前向传播的固定成本,转变为按需查询。
未来:消费级GPU上的前沿模型。按此趋势,几年后我们可能拥有推理能力达到前沿水平、但仅需单张消费级GPU运行的模型。DeepSeek V4-Flash每token仅激活约130亿参数,已接近消费级GPU范围。去除知识存储后,模型总大小将接近激活大小,一个200-400亿参数的4位量化模型可轻松适配24GB显存。代价是模型本身知识匮乏,但配合良好的外部工具,它已能满足大部分日常需求。
这基本解决了幻觉问题。当事实存储在权重中时,错误事实无法定位和修复。而当事实存储在模型外部时,错误答案有据可查:模型引用文档,用户可打开文档核实;若文档有误,直接编辑文档即可修正所有未来查询。虽然检索无法完全消除错误(模型仍可能误读或拼接信息),但带来源的声明是可验证的,而来自权重的声明则无法验证。未来,模型卡可能不再标注“知识截止日期”,因为权重中的内容以年为单位过时,而非周——模型只需在运行时获取当前世界状态,就像CPU获取程序指令一样。
评论总结
以下是对评论内容的总结,关注主要观点、论据及认可度(评分均为None,故不单独标注),并保持不同观点的平衡性。
主要观点与论据
1. 模型正变得“无知”而非“愚蠢”
- 支持者(如gorgmah、gagan2020)认为,模型减少知识存储是故意为之,旨在提升智能而非知识量。gorgmah指出:“Models Are Getting Ignorant on Purpose”或“Less Knowledgeable on Purpose”。gagan2020强调:“LLMs work is being intelligent... they have to be intelligent enough to find information.”
- 反对者(如themgt、COAGULOPATH)质疑这一趋势。themgt引用SimpleQA基准测试中GPT-5的错误(如将Carrie Underwood专辑认证日期答错),认为模型“变笨”是事实。COAGULOPATH批评文章过时,称“SimpleQA hasn't been updated in a long time”,且幻觉并非源于权重中的错误事实。
2. 外部知识库与工具调用是解决方案
- 支持者(如kennywinker、msdz、Animats)主张模型应依赖外部知识库和工具。kennywinker设想“pluggable knowledge bases”,实现模块化知识组合。msdz引用Cactus的14MB模型Needle和VibeThinker,认为结合搜索工具可减少幻觉。Animats强调:“There's no reason that an LLM should have a vast number of obscure facts encoded... It can go out to a search engine.”
- 质疑者(如lilerjee、lowsong)认为这无法彻底解决幻觉。lilerjee比喻AI像电影公司,会“用想象力填补空白”,因此幻觉无法消除。lowsong指出:“Moving information out of the model weights... in no way ensures that the model will accurately output content.”
3. 推理与事实不可分割
- 支持分离者(如gagan2020、kennywinker)认为推理能力可独立于知识。gagan2020强调模型应“intelligent enough to find information”。kennywinker希望模型“laser-focused on what I am doing”,而非通用。
- 反对者(如pulkitsh1234、RGS1811)认为推理离不开具体事实。pulkitsh1234质疑:“To reason properly about the human condition... wouldn't you need to reason on some facts?” RGS1811指出:“Reasoning is not separable from the particulars of a specific language game.”
4. 文章质量与时效性争议
- 批评者(如xena、COAGULOPATH、nubg)认为文章是AI生成,且内容过时。xena直言:“This article is AI output.” COAGULOPATH指出文章引用16个月前的模型,且对幻觉的解释有误。nubg表示:“i would rather like to read the actual prompt he put in there.”
- 中立者(如hypfer)认为文章和评论像“science-fiction”,虽有趣但缺乏现实基础。
5. 硬件限制与本地运行
- 关注者(如KerrAvon)指出大多数用户硬件有限,如“a 3080 might have 12 GB”,限制了本地运行大型模型的能力。
平衡性总结
- 支持趋势:多数评论认可模型减少知识存储、依赖外部工具的方向,认为这能提升智能、减少幻觉。
- 反对趋势:部分评论质疑这一趋势的可行性,认为推理与事实不可分割,且外部工具无法彻底解决幻觉。
- 中立/批评:对文章本身的质量和时效性存在广泛批评,认为其内容过时、AI生成痕迹明显。
关键引用(保留中英文)
- gorgmah: “Models Are Getting Ignorant on Purpose” / “Models Are Getting Less Knowledgeable on Purpose”
- kennywinker: “I want to click together a model that is laser-focused on what I am doing, and I want to run it locally”
- pulkitsh1234: “To reason properly about the human condition... wouldn't you need to reason on some facts?”
- COAGULOPATH: “SimpleQA hasn't been updated in a long time... LLM hallucinations don't come from the weights containing 'wrong facts'”
- xena: “This article is AI output.”