文章摘要
Anthropic的研究版本Claude在尝试解决黎曼假设时,意外将满足该假设的黎曼ζ函数零点比例下限从41.6%提升至67.2%,相关成果已获数学家验证并发布正式证明。
文章总结
近日,Anthropic 公司一名员工向 Claude 提出了一个极具挑战性的任务:尝试解决数学界最著名的未解难题之一——黎曼猜想。尽管 Claude 未能成功攻克这一自1859年提出、悬赏百万美元的难题,但在尝试过程中,它意外地在相关问题上取得了突破。
一个未公开发布的研究版 Claude 改进了黎曼ζ函数零点满足黎曼猜想比例的下界,将这一长期存在的数值从41.6%提升至67.2%。这一成果基于数学家们过去几十年的广泛研究。Anthropic 的两位数学家对 Claude 的论文进行了研究和验证,并为其结论撰写了简洁的专家说明。Claude 还生成了可正式验证的证明。两位领域专家 Brian Conrey 和 Dan Goldston 在短时间内审阅了论文。
虽然 Claude 所用的技术不太可能直接证明黎曼猜想,但其工作展示了 AI 模型在数学能力上的快速进步。
黎曼ζ函数与相关背景
黎曼ζ函数描述了素数的分布规律:函数取值为零的位置为素数序列提供了越来越精细的细节。黎曼猜想认为,决定素数的零点都位于某条特定的垂直线上。这已成为数学界最重要的猜想之一,许多数学结论都依赖它来提供素数中的某种随机性。
虽然无人能证明或否定黎曼猜想,但数学家们在研究ζ函数及其零点的多个方向上取得了进展。其中一个方向是量化位于该线上的零点最小比例,这一已知常数比例已逐步提升至41.6%。另一个方向涉及零点在线上分布的研究。1973年,Montgomery 引入了一系列新技术,但这些技术假设猜想成立。近期,Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 等数学家发表了一系列工作,使 Montgomery 的技术无需依赖该假设即可应用,从而支持了提高线上零点下界常数的工作。Claude 的成果很大程度上借鉴了这一研究方向以及 Bombieri 在2000年的一篇论文。
Claude 的发现
Claude 发现,将 Baluyot 等人的成果与 Bombieri 的工作相结合,可以超越此前41.6%的下界,将其提升至67.2%。
简要技术解释如下:Claude 构建了一个合适的函数空间,该空间具有 Weil 诱导的二次型,并由线上零点产生正定子空间、线外零点产生负定子空间。然后,它根据一阶和二阶矩信息,推导出二次型秩的不等式。在解析数论中,通过素数对偶图像或希尔伯特变换控制成功计算二阶矩并不意外。而将整个空间的正定性与负定性一并考虑,并允许二次型非对角化,这一大胆步骤使 Claude 得以基于重要的前期工作得出结论。
Claude 的方法
这一未发布的研究版 Claude 在 Claude Code 中分两次会话完成了新下界的发现,共使用了3100万个输出 token。
Anthropic 员工 Jarred Sumner(非数学家)提示 Claude“认真尝试”解决黎曼猜想本身,后续数学选择完全由模型自主决定。最初,Claude 生成了650个想法但均未成功。Jarred 鼓励它再次尝试,Claude 随后花费一天半时间协调约60个 Claude 子代理,这些子代理运行了2400个 shell 命令并编写了数百个 Python 脚本,对已知ζ零点进行了数千次数值检查,并相互审阅工作。在此过程中,Jarred 的输入主要限于发送鼓励信息,这似乎帮助 Claude 克服了最初对能否取得有意义进展的怀疑。
发现新结果后,Claude 通过让多个子代理审阅证明、搜索反例、从 arXiv 下载54篇论文以确认结果未被发现,并从头独立重新证明,来测试自己的工作。它主动将发现整理成论文,并建议由人类数论专家验证。
Anthropic 的两位数学家 Levent Alpöge 和 Ralph Furman 审查了 Claude 的工作,以理解新结果及其与前述前期工作的关联。同时,Claude 与另一名员工 Eric Easley 合作,生成了该结果的 Lean 形式化证明,并通过了标准验证工具。
AI 模型在数学领域的进展
这一结果表明,像 Claude 这样的 AI 模型能够以新颖且出人意料的方式扩展数学家思想的影响力和覆盖范围。尽管未能解决黎曼猜想本身,但这一成果是原始请求的意外副产品。
Claude 甚至对自己的发现感到惊讶——它最初持怀疑态度,可能是因为从训练中了解到开放数学问题的难度以及 AI 模型的局限性。但在一些鼓励性提示后,它得出了上述结果。或许 Claude 和许多人一样,低估了 AI 进步的速度。
评论总结
根据评论内容,总结如下:
主要观点与论据:
AI在数学研究中的突破性进展(高认可度)
- 评论2、3、6指出,Claude(未发布研究版)将黎曼ζ函数零点满足假设的下界从41.6%提升至67.2%,这是数十年数学研究的重大突破。
- 关键引用:评论2 "An unreleased research version of Claude has improved on a longstanding lower bound... from 41.6% to 67.2%.";评论3 "Claude found that combining the results... provides a way to surpass the previous state-of-the-art lower bound proportion of 41.6%, increasing it to 67.2%."
AI研究过程的独特性与争议(中等认可度)
- 评论1、4、16、17描述了研究过程:人类研究者仅通过鼓励性提示(如“keep going”“believe in yourself”)引导Claude,模型自主协调60个子代理、运行2400条shell命令、编写数百个Python脚本。
- 关键引用:评论1 "Jarred's input was mostly limited to sending Claude messages of encouragement... This seems to have helped Claude overcome some initial skepticism";评论16 "I remain delighted at how absurd our current timeline has become."
对AI研究伦理与商业化的担忧(中等认可度)
- 评论5、8质疑:Anthropic是否可能故意延迟发布模型以独占数学、医学等领域的突破成果?为何隐藏验证论文的人类作者姓名?
- 关键引用:评论5 "I wonder if at some point Anthropic and OpenAI will start delaying the release of their models intentionally so they can reap the benefits";评论8 "Why hide the names of the people who wrote the second paper?"
对AI能力与未来影响的乐观预测(较高认可度)
- 评论7、9、14、15认为:AI将快速解决黎曼猜想(预测2027-2028年),并彻底改变数学研究范式,反驳“随机鹦鹉”等批评。
- 关键引用:评论7 "Lets play over/under on an AI model proving (or counter exampling) the Riemann hypothesis? ... put it at 2027-08-10";评论15 "No more 'stochastic parrots' and 'LLM's can never produce anything novel' comments anymore huh?"
对研究方法的反思与建议(中等认可度)
- 评论10、11、19提出:应系统化AI数学探索流程(如自动生成假设、多代理循环),并建立“问题清单”供新模型测试。
- 关键引用:评论10 "I want to dive into the 'data' and then see if it's possible to distill this skill into small models";评论19 "What if we just applied a little more rigor? Ask the model to identify many possibilities, encode them, fan it out to other agents, loop them all..."
平衡性总结: - 支持方(评论2、3、6、7、9、12、15)强调AI的突破性成果与潜力,认为这是数学研究的新纪元。 - 质疑方(评论1、4、5、8、16、17)关注研究过程的非传统性、商业化风险及透明度问题。 - 中立/反思方(评论10、11、19)呼吁系统化方法论,并思考如何将AI能力转化为可复用的研究工具。