AI产业链 / L5-AI应用与智能体 / AI for Science · 2026-09-09

📅 2026-09-09🏷 AI产业链 / L5-AI应用与智能体 / AI for Science

AI for Mathematics

近期模型解决了很多数学问题,梳理哪些模型在什么时候解决/推动了什么数学问题?如何客观评价这类成果,这是传统计算机在解决或者辅助解决数学问题能力的横向拓展,还是AI能力到了下一个层级?

一、近期AI解决/推动的重要数学问题(时间线梳理)

2024年:AI首次达到IMO奖牌水平

2024年7月,Google DeepMind的AlphaProof(结合AlphaGeometry 2)在2024年国际数学奥林匹克竞赛(IMO)中解决了6道题中的4道,获得相当于银牌的成绩。这是AI首次在IMO级别竞赛中达到奖牌水平。团队通过自动形式化约8000万个数学命题,利用强化学习训练AlphaProof探索证明路径。

2025年:密集突破——从奥赛金牌到开放难题

2025年2月,DeepMind发布AlphaGeometry 2,能够解决过去25年IMO几何题中84%的问题,表现超过人类金牌得主平均水平。

2025年7月,Google DeepMind的Gemini Deep Think(高级版)在2025年IMO中解答了6道题中的5道,获得35分,达到金牌水平。此后该模型在IMO-ProofBench Advanced测试中得分高达90%。

2025年7月,字节跳动的Seed Prover在IMO 2025中解决了6道题中的4道及部分证明,达到银牌成绩;其升级版Seed Prover 1.5在16.5小时内为前5道题生成了完整可编译验证的Lean证明代码,换算成绩35/42,达到金牌分数线。

2025年10月,OpenAI的研究员宣布其模型在数学研究上取得重要突破。

2025年11月,DeepSeekMath-V2开源发布,在IMO 2025和CMO 2024上取得金牌级成绩,在Putnam 2024上取得118/120(接近满分),超过人类最高分90。这是首个达到IMO金牌水平的开源数学模型。

2025年12月,Claude Opus 4.5(通过Numina-Lean-Agent)解决了Putnam 2025的全部12道题。

2026年:攻向研究级难题——Erdős、黎曼、费马大定理

2026年1月,GPT-5.2 Pro独立完成了一个悬而未决45年的数论猜想的证明。

2026年3月,ChatGPT-5.2 (Thinking)成功破解了一项此前悬而未决的数学猜想(Ran与Teng在2024年提出的猜想),这是商用LLM首次原创独立证明数学假设。

2026年5月,Google DeepMind发布AlphaProof Nexus,一口气攻克了9道Erdős开放问题,其中最古老的悬了56年(Erdős #12,1970年提出)。所有证明均经过Lean编译器形式化验证。同期,Claude Mythos也独立证明了Erdős单位距离猜想。

2026年5月,Google发布 "AI Co-Mathematician"(AI联合数学家) ,帮助牛津数学家Marc Lackenby破解了群论领域悬而未决的Kourovka Notebook第21.10号问题。该系统在FrontierMath Tier 4(被描述为"数十年内AI都可能无法攻克"的难题集)上取得48%准确率,刷新SOTA。

2026年8月,Anthropic Claude将黎曼ζ函数非平凡零点位于临界线的渐近比例下界从约41.6%提高到67.2%,并给出了Lean形式化证明。

2026年9月初,OpenAI GPT-6 Astra在有界素数间隔问题上取得新成果,将素数间隔上界从246降至186。

2026年9月4日,Anthropic Claude在约11天内大体自主地用Lean完成了费马大定理的首个完整计算机核验证明。

2026年9月5日,研究者使用GPT-5.6/6搭配Hermes Agent完成了陈景润定理("1+2")的形式化证明。

二、如何客观评价这类成果

1. 需要区分"解题"与"研究"的层次

目前AI的数学成就大致可分为三个层次:

层次代表成果特点
竞赛解题IMO金牌、Putnam满分有明确答案和已知解法路径,可验证
开放问题求解Erdős 9题、45年数论猜想无已知解法,需原创思路,但问题本身已明确
理论体系构建尚未出现提出新概念、新框架、新方向

当前AI的突破主要集中在前两个层次。即便是AlphaProof Nexus解决的Erdős问题,也是"已形式化的开放问题"——问题本身已被数学家翻译成形式语言,AI在既定框架内寻找证明。真正"提出新猜想、创造全新概念、搭建完整理论体系"的能力,仍是人类的专属领域。

2. 形式化验证是"双刃剑"

一方面,Lean等证明助手的引入使得AI的证明可以做到零幻觉、零错误——编译器通过即证明成立。这是传统"黑箱"AI无法比拟的可靠性。

另一方面,形式化本身是一道门槛。OpenAI关于有界素数间隔的论文中,形式化部分仍依赖三个尚未在Lean中证明的外部输入假设。这意味着AI的"证明"能力目前仍受限于形式化数学的覆盖范围。

3. 人机协作仍是主流范式

大多数重大突破并非AI单打独斗。ChatGPT-5.2证明数学猜想经历了7轮人机对话,人类全程把控逻辑完整性;牛津数学家使用AI Co-Mathematician时,AI第一次给出的证明是错的,被审查Agent揪出漏洞后,人类才意识到如何填补。AI更像个"加速器"而非"替代者" ——它擅长穷举探索、快速试错、发现模式,但最终的判断和理论构建仍需人类。

4. 算力成本与可复制性

AlphaProof Nexus解决每道Erdős问题的算力成本仅几百美元。这意味着AI辅助数学研究的门槛正在急速降低,但也引发了对"成果含金量"的讨论——如果证明可以低成本批量生产,数学的价值评判体系是否需要重构?

三、这是"工具拓展"还是"能力跃升"?

我的判断是:两者兼有,但更接近"质变前的临界点"。

支持"工具拓展"的论据

AI目前解决数学问题的方式,本质上仍是大规模搜索+模式匹配的延伸:

  • AlphaProof的核心是强化学习在形式化命题空间中的树搜索
  • AlphaProof Nexus的核心是"进化算法+LLM+Lean编译器"的组合
  • AI Co-Mathematician本质上是为数学家构建了一个"AI版的研究生" ——一个异步协作、能并行探索多条路径、能记住失败假说的智能工作空间

从技术路径看,这些系统仍是传统计算工具(搜索、验证、枚举)与LLM的工程化集成,而非某种全新的"数学直觉"。

支持"能力跃升"的论据

然而,以下事实表明这不只是量变:

  1. 原创性突破:GPT-5.2 Pro独立证明45年数论猜想、Claude Mythos证明Erdős单位距离猜想——这些问题没有已知解法,AI确实"想出了"人类没想到的路径。
  1. 速度与规模:AlphaProof Nexus一次性攻克9道悬置数十年的难题,每道仅需几百美元——这种"批量解决"能力已远超任何人类数学家的工作节奏。
  1. 认知范式的改变:2026年菲尔兹奖得主雅各布·齐默曼公开表示"两年之内,AI做数学会比数学家更好",并宣布加入OpenAI。如果这仅仅是"更好的计算器",不会引发顶尖数学家如此判断。
  1. 从"做题"到"研究"的跨越:FrontierMath Tier 4的问题被设计为"数十年内AI都可能无法攻克",而AI Co-Mathematician已拿下48%。人类对AI能力边界的预估正在被反复打破。

更准确的定位

或许可以将当前状态描述为:AI在数学领域正从"计算器"进化为"合作者" ——它还不是"数学家"(不会提出新问题、不会构建新理论),但已不再是"工具"(能够独立发现人类未见的证明路径)。

2026年菲尔兹奖被一些人称为 "人类的最后一届菲尔兹奖" 。这个说法或许夸张,但它捕捉到了一个真实趋势:AI正在从"辅助人类做数学"迈向"与人类共同做数学"的新阶段。这不是传统计算机辅助的简单横向拓展,而是数学研究范式的结构性转变——就像望远镜之于天文学、显微镜之于生物学,AI正在成为数学的"新感官"。