别再笑大模型只会刷奥数了,DeepMind这次用几百刀扫平了9个数学大悬案
导语:大模型正告别做题家身份。DeepMind用自主AI证明系统,成功攻克数学界9个埃尔德什开放性难题。
数学界和人工智能界刚刚迎来了一次低调却极具颠覆性的“海啸”。
就在最近,谷歌 DeepMind 团队宣布,他们的大模型智能体在一项大规模形式化证明评估中,一口气解开了 9 个处于开放状态的埃尔德什(Erdős)数学猜想。这不仅是 AI 自主解题的胜利,更致命的是,这 9 个问题的解答全部通过了 Lean 编译器的形式化自动验证,并最终得到了人类顶尖数学家的现场复核与承认。
这标志着数学史上首次针对研究级开放问题开展的大大规模、自动化的形式化证明搜索。从这一刻起,大模型已经脱离了“做题家”的标签,开始正式迈入真正的“科研工作者”队列。
这项研究不仅在学术圈引发震荡,其背后的方法论更是给大模型推理能力的进化指出了一条清晰的路径。DeepMind 随后在 arXiv 上公布了相关论文,直指 AI 驱动的形式化证明搜索技术(AI-Driven Formal Proof Search)在数学前沿领域的实操潜力。论文表明,他们开发的新一代 AI 智能体不仅成功证明了 353 个经典的 Erdős 难题中的 9 个,还证明了 OEIS(整数数列百科全书)数据库中 492 个猜想中的 44 个。目前,该成果正被快速引渡到组合数学、优化理论、代数几何、图论乃至量子光学等更具产业实用价值的领域中。
打破数学“幻觉”:AlphaProof Nexus 到底强在哪?
熟悉大模型的读者都知道,大语言模型虽然在数学推理上越来越有灵气,但不可预测的逻辑“幻觉”和计算偏差依然是其致命伤。在追求绝对严密的数学推演里,差一个括号或者一个逻辑符号,整个大厦都会崩塌。如何把大模型天马行空的发散思维,训导在绝对严密的逻辑轨道之内?
DeepMind 给出的方案是:AlphaProof Nexus 框架。它的核心工作逻辑,本质上是把大语言模型的“生成创造力”与 Lean 语言编译器的“绝对铁律”进行高强度的闭环链接。

在配有 AlphaProof Nexus 的智能体运作流程中,人类数学家不需要费尽心思去从零写代码。你只需要提供一个包含证明占位符的雏形代码草图——也就是在未证明的部分用 sorry 作为占位符标记,并明确圈定出 AI 可以自由发挥的编辑区块。在这个设定好的“沙盒”内,规划宏观证明策略、构筑逻辑引理、微调底层参数等一系列极耗精力的工作,都交由智能体在闭环中自主推演和试错,直至代码通过 Lean 编译器的验证。
在此次的研究中,DeepMind 的团队设计并比对了两种不同维度的智能体架构,它们各自的表现很有意思,直接揭示了未来 AI 智能体进化的风向标:
1. 基础智能体:去中心化的“脑力大激荡”
这是一种极其简约的架构。系统会同时启动多个互不共享状态的子智能体。每个子智能体在遇到问题时,底层模型(如 Gemini 3.1 Pro)会通过思维链(Chain of Thought)进行推理,并不断尝试调用“搜索和替换”工具来重构代码草图。一旦修改完代码,Lean 编译器就会立即对其进行“质检”。如果提示报错,模型就带着编译器给出的报错日志进行自我检讨和反思,紧跟着进入下一轮自适应修改。这个基于“编译反馈”的闭环会持续运转,直到整条逻辑链再无任何漏洞。
2. 全功能智能体:大模型法官与奥数强化的结合体
在这个架构中,研究人员引入了更具全局观的设计:利用一个大模型(Gemini 3.0 Flash)来当“裁判”。裁判员会对所有的证明草图进行清晰度、合理度以及新颖性评估,并给出 Elo 积分。这种演化算法能够自动筛选并扩充优质的“证明种子”,让系统朝着高分方向不断演进。同时,该智能体还配置了经过硬核数学竞赛(奥林匹克数学级别)强化学习训练的 AlphaProof 模块作为辅助解题引擎,提供微观推导支援。

在实验之前,按照大家的直觉,功能武装到牙齿的“全功能智能体”理应呈现降维打击的态势。但测试数据却出了一个不大不小的冷门:即便是设计极其简单的“基础智能体”,在 Gemini 3.1 Pro 底座的加持下,同样成功解出了所有 9 道埃尔德什难题。
这释放出了一个强烈的行业信号:随着通用基座大模型智能密度的急速上升,以往被认为非常必要的特化训练、复杂多智能体社会学设计,其边际收益正在减少。只要有了编译器这种绝对客观的硬反馈作为边界,哪怕只是实施最简单直白的“思考-尝试”循环,大模型爆发出自主生成高难度逻辑证明的能力也已经超乎想象。
一举扫平九大埃尔德什悬案,AI 到底干了什么?
保罗·埃尔德什是 20 世纪最具影响力的数学大师之一,他一辈子提出了大量充满直觉和美感的数学问题与猜想,遍布组合数学、数论及几何领域。这些问题看似简单,实则如诱人的“逻辑泥潭”,长年吸引着无数数学天才为其耗尽心血。以下正是本次被 DeepMind 彻底攻克的 9 个数学开放性难题:
问题 12 (i) —— 避免整除的密集整数集
这是埃尔德什在 1970 年提出的问题。它探讨的是:是否能在正整数中构造一个无穷大的集合,使得该集合中任意两个数的和,都无法被集合中的另一个数整除。同时,这个集合在整个正整数世界里还要具备足够的“密集度”(满足特定的下密度限制)。面对这个难题,AI 在逻辑链中将经典的中国剩余定理与避免算术级数的构造法高度融合,证明了这一集合确实存在,给出了令人信服的肯定回答。
问题 12 (ii) —— 避免整除的更高密度极限
这是上一题的极限升级版。它抛出了更高的胃口:不仅要满足互不整除的特性,还要将集合的密度逼近其理论上的最高极限。AI 此次巧妙地采用了 Behrend 风格的构造策略,在数学逻辑极其狭窄的限制通道中,成功定位到了那个满足严苛要求的无穷集合,顺利终结了这一长达半个世纪的数学争论。
问题 125 —— 不同进制数字集合的加和密度
埃尔德什在 1996 年提出过这样一个有趣的边界猜测:假设有两组特定的数字合集,一个是仅由 0 和 1 在三进制下表示的数,另一个是仅由 0 和 1 在四进制下表示的数。若将两个集合中的数字任意挑出来做加法运算,由此生成的新和集,其分布频率(下密度)是否大于零?AI 另辟蹊径,调遣丢番图逼近原理进行解构,严格论证了新集合的分布密度在数值规模放大后会迅速被稀释,最终以无可辩驳的逻辑证明其极限下密度为零。
问题 138 (变体) —— 颜色与数列的间隔极限
该猜想源于组合数学中著名的范德瓦尔登定理,主要探讨当连续整数被染上不同颜色时,为了绝对保证存在同色且长度为定值的等差数列,这个数列间隔长度与数集总规模的对应趋势。AI 利用贪心染色扩展算法,配合巧妙的局部矛盾排除法,最终给出了严谨的界限证明,为这一猜想的发展画上了完美的句号。
问题 152 —— 西顿集中的孤立点推演
西顿集(Sidon Set)是一个任意两个元素之和均不相同的特殊数集。埃尔德什在 1994 年试图厘清,当西顿集的规模巨大时,两两相加的新数集中是否会出现大量的独立“孤立点”(即其相邻位置的数值不在集合中)。AI 通过开展极其细腻的边界分析,精确剥离了偏移邻居和内部点的逻辑分布,成功给出了解明。
问题 741 (i) —— 集合拆分后的加和密度
这是一个极具直觉复杂度的集合分割难题。假设有一个数集,它与自身两两相加得到的和集规模非常庞大,在自然数世界里占有相当的比例(即所谓的正上密度)。那么,我们是否能够强行将该集合一分为二,使得分出来的这两个子集各自与自身相加,生成的新和集依然能保持足够的密集度?对此,AI 用逻辑论证给出了坚实的肯定的答案。
问题 741 (ii) —— 集合拆分与间隙界限
这是前者的姐妹问题。AI 深入研究了这种具备“禁区”结构的特殊二阶基集合。结果表明,无论你怎样尝试去拆分,被拆分出来的两个子集中,总会有至少一个子集在进行自相加时出现无法弥合的、“无限扩张”的数值大断层(也即是无法确立有界的区间间隙)。
问题 846 —— 平面点集的几何悖论
这是一个十分抽象的二维空间几何构想。AI 依靠极其扎实的代码迭代,证明了平面中可以存在一个无穷大的点集:即使在这个集合里随机抽取任意有限个点,其中绝大多数点也呈非共线状态(没有三点共线)。然而,这个无限大点集又存在一种诡异的性质——你永远无法打破平衡,把它拆分到几个数量有限、且“内部绝对不存在三点共线”的子集中去。
问题 26 (延伸变体) —— 整数倍数密度的极值
这关系到数论的核心问题,即整数倍数的自然分布规律。AI 借由动态增长的质数序列,实施了极富创造力的迭代构造。结论证明,存在特定的正整数序列,当你给这个序列中的每一个数字都叠加上同样的正整数偏移常量后,这些新元素派生出的全部倍数在自然数系中的比重,会被死死卡在四分之三这一特定上限以内。
一次计算只要几百美元,AI 代替科研人员还有多远?
在很多人眼里,AI 烧钱研发是常态,尤其是训练和调用超大规模强化学习模型。然而 DeepMind 透露的成本结构让人极其惊讶。在实际运行中,AI 在攻克这些难题时,不同性质的关卡所需的算力截然不同。大多数埃尔德什问题上的计算开销都在几十美金到几百美金之间。其中最简单的几题,甚至只花费了 7.5 到 15 美元的 API 调用额度。
几十美元就能推动一件长达半世纪未决的纯数学学术课题往前迈出一大步,这个性价比几乎已经到了惊人的地步。与高昂的人类科研人员时间和资源分配相比,这种极高性价比的模型推导将快速颠覆现有的科研协作模式。
事实上,AI 在数学前沿取得决定性胜利已经不再是孤立事件。回顾不久前,OpenAI 也宣布通过其强推理模型,成功否定了拥有近 80 年历史的“平面单位距离猜想”(Erdős Unit Distance Problem)。本周 DeepMind 的跟进,恰恰给这个趋势添上了一把烈火。人类正站在一个深刻的科技拐点上:AI 的能力半径,正从复刻人类已知经验,全面切入到在人类未曾踏足过的深海“无人区”里,自主挖掘、构造并证明新的客观知识。
当 AI 开始作为数学甚至物理研究中的首要生产力,科学探索的运转齿轮已经在疯狂换挡。当计算成本不断被稀释,而在绝对逻辑工具的闭环看守下,形式化证明搜索的边界将被无限拉长。一个属于科学发现的指数化加速时代,比绝大多数人料想的还要来得快得多。接下来的组合优化和量子计算领域的工程实践里,可能随时会诞生下一个由这套智能体系统推演出来的关键定理,让我们拭目以待。