AI产业链 / L5-AI应用与智能体 / AI for Science · 2026-09-08

📅 2026-09-08🏷 AI产业链 / L5-AI应用与智能体 / AI for Science

OpenAI 宣称 88 小时解出纳维-斯托克斯方程:数学家质疑数据与思路来源,25 位菲尔兹奖得主联署「严重错位」

2026 年 9 月 8 日,OpenAI 宣布其一个尚未公开的下一代内部模型(能力显著强于 GPT-6 Astra)组织约 1 万个并发 AI 智能体,用 88 小时给出了纳维—斯托克斯方程(N-S)存在性与光滑性问题的证明,同步公开 166 页论文与 Lean 形式化验证代码。

该问题是克雷数学研究所(CMI)2000 年设立的七大千禧年难题之一,悬赏 100 万美元。OpenAI 表示不会申领这笔奖金。

一、这次「解题」消耗了多少算力

指标数值
并发智能体约 10,000 个
智能体间消息约 270 万条
输出 token约 1,300 亿
出解耗时88 小时(9 月 5 日得到解法)
Lean 形式化验证Astra 另耗 17 小时
总成本估算约 1,000 万 ~ 2,250 万美元

组织方式上,智能体被分组、各组拿到不同题面,可读缓存互联网、跑代码并在组内交流;近 100 个智能体先用约 50 小时做出无外力欧拉方程的有限时间奇点,随后资源转向 N-S,由 Codex 汇总各组思路并交叉分发。

二、路线分歧:证的不是原题

N-S 问题的核心是:三维流体的光滑解能否永远维持,还是在有限时间内出现奇点(速度发散到无穷)。

OpenAI 没有去证明「无外力解必然光滑」,而是选择克雷题目的 C、D 方向——构造有限且处处光滑的外力,使光滑解不能维持到所有时间。部分数学家随即指出,这个版本依赖了大多数人在讨论该问题时会略去的「外力项」,因此与公众所理解的「解出千禧年难题」并不完全等同。CMI 至今未对结果作任何认证,其主席 Martin Bridson 的表态也相当克制,只说这是「人类理解数学取得重大进展的令人兴奋的一天」,止步于确认之前。

三、优先权与数据来源争议

纽约大学数学家 Tristan Buckmaster 与 Anthropic 研究员 Levent Alpöge(以个人身份参与)沿一条冷门路径推进同一问题,起点是 Diego Córdoba 与 Luis Martínez-Zoroa 的 forcing 技术——Buckmaster 称「我认识的人里几乎没有别人在做这个方向,这不是给模型一个题面、几天之内就能走到的路」。

时间事件
8/15两人在欧拉方程(N-S 的无摩擦版本)上取得关键进展
8/22完成验证
8/28OpenAI 开始训练新的内部模型
9/1OpenAI 听到「两个千禧年难题被解决」的传闻,随即把智能体投向其余未解千禧年难题
9/3Buckmaster 主动邮件联系 OpenAI
9/6(周日)与 OpenAI 的 Sébastien Bubeck 通话
9/7 23:58Buckmaster / Alpöge 公开成果
9/8OpenAI 宣布 N-S 结果

Buckmaster 的核心质疑是:他此前曾把未发表的草稿与推导放进 OpenAI 的 Codex 里处理,怀疑这些会话影响了模型的训练数据。他自述在通话中反复追问训练相关问题「没有得到回答」,并称对方曾提议让他单独署名(把 Alpöge 排除在外),在他表示将公开后得到的回应是「Why would you ruin your career?」。Bubeck 否认曾要求删名;Sam Altman 称两份方案在都公开之后看起来已不相同。

OpenAI 的回应值得逐字读:研究人员与智能体在其成果公开发布前「没有通过任何途径看到他们的工作」,特别是「没有为解题而访问任何特定用户数据」;但紧接着承认,「虽然可能性不大,我们无法排除源自他们使用我们产品的去标识化数据帮助改进了我们的模型」。

去标识化(de-identified)并不等于未被使用——它只移除了身份标识,底层的思路与内容仍可能进入训练。真正的麻烦在于,这是一个服务条款允许、但研究者并未知情同意的区间。另一位数学家 Andreas Thom 此前也提出过同类质疑:他就自己关于相关研究的私人 ChatGPT 对话,询问是否影响了更早的一项 OpenAI 数学成果,得到的答复是「没有发生」,但对方并未澄清这些对话是否会用于训练。

四、25 位菲尔兹奖得主联署:「目标严重错位」

9 月 11 日,25 位菲尔兹奖得主在 mathandai.org 联名发布《A Severe Misalignment of AI in Mathematics》,签署人包括陶哲轩(Terence Tao)、邓煜、Peter Scholze、Manjul Bhargava、Maryna Viazovska、June Huh、Martin Hairer 等;截至媒体报道时已累积约 2,400 名支持者。声明未点名 OpenAI,但时间点指向明确。

其核心论点不在「AI 能不能做数学」,而在目标函数不同:

Over the last few months, the mathematical capabilities of LLMs have improved dramatically... However, the push by AI companies to solve mathematical problems as a benchmark is detrimental to the science of mathematics, and to the mathematical community. The goals of the AI companies and the goals of the mathematical community are severely misaligned.

Solving problems is only a tool and proxy for achieving the primary goal of conceptual understanding and insight... the mass production at faster and faster pace of "true/false" statements could destroy fertile ground instead of breathing life into new ideas.

声明同时承认 AI「有潜力增强并加速真正的数学研究」,并不主张拒绝 AI。它反对的是三件事:① 把著名难题当作模型能力的营销基准;② 成果发布仓促、没有正式论文、未充分引用前人工作,由此衍生出署名与抄袭问题;③ 可能造成的知识传承断裂——若无人愿意花时间消化、简化、写进教材,这些思想就永远不会「活过来」。

陶哲轩(2006 年菲尔兹奖,长期是 AI 用于数学的积极推动者,自己也大量使用 AI)这次的态度最值得注意——他不是从反对者转投而来,而是把既有的保留意见推到了临界点:

  • 数学发现要经过创造 → 检验 → 解释 → 接受 → 纳入传承五个阶段,AI 公司基本只做前两个,「剩下的全留给我们清理,这令人沮丧」。
  • 「这些公司把生肉的尸体倒在我们村子的公共餐桌上,说:拿去,我解决你们的吃饭问题了。然后就走了。」
  • 「现在没有速度上限了,事情突然就崩了。」
  • 「N-S 正则性只是被 AI 露天开采(strip-mined)的一系列问题里最新的一个。」
  • 类比:只看一部电影的开头和结尾,情节线都解开了,但体验的价值大部分已经丢失。
  • 引 Thurston(1994):「衡量我们成功的标准,是我们所做之事是否让人能更清晰、更有效地理解和思考数学。」
  • 结局判断:「它最终会进教科书,只是通往那里的一条极其下作的路。」

其他声音:华威大学 James Robinson 称这种竞争是「幼稚的操场吹牛」。2010 年菲尔兹奖得主 Stanislav Smirnov(日内瓦大学)在接受《中国新闻周刊》专访时给出了最锋利的一个比喻——他指出,把数学家比作抱怨被挖掘机取代的掘土工人是错的:

应该把这一比喻放进考古挖掘的场景里。挖掘机的速度确实更快,但可能会破坏珍贵文物;这些文物如果由一群慢得多的人工来发掘,将得到很好的保存。

Smirnov 明确表态:大模型在未注明作者的情况下挪用他人思想,或使用未发表的思想,若换作人类数学家会被视为对学术伦理的严重违反——「有人认为 AI 抄袭人类是可以接受的,我并不认同」。 他认为 AI 擅长理解已知信息、做实验、检验现有方法,但「在判断新方法的有效性或提出真正新颖的想法方面表现不佳」。

五、投资与产业视角

1. 科研正在成为推理算力的新需求侧,但单位经济性极差。 88 小时、1,300 亿输出 token、上千万美元成本,换回的是一个尚未被 CMI 认证、且被指出「证的不是原题」的结果。这既是「AI for Science」叙事的有力证据,也是算力支出的成本—成果比的负面样本。把它当作需求侧上修逻辑是成立的(前沿科研会持续吞掉推理算力);但把它当作「AI 已能自主产生科学价值」的估值支撑,还需要等独立验证落地。

2. Lean 形式化验证工具链是隐性受益方。 本次 Astra 要再花 17 小时把证明形式化,说明「可机械检验」已成为前沿成果的准入门槛。这对数学数据资产、定理证明器与评测基础设施(而非模型本身)构成持续需求。

3. 数据的「隐性转移」正在成为闭源 API 的定价因子。 研究者把未发表草稿喂进商用工具,等于向厂商无偿转移了尚未定价的高价值知识产权;而厂商在服务条款允许的范围内使用它,事后再说明「无法完全排除」。这会削弱闭源 API 在保密型工作流中的渗透率,把需求推向私有化部署与开放权重模型。这一点与同站笔记《Palantir、英伟达、博思艾伦收紧使用 Anthropic 模型》同源,可对照阅读。

4. 中美视角。 国产开源权重模型(DeepSeek、Qwen、GLM、Kimi 等)在「数据可以留在自有环境」这一条上具备结构性优势,对高校与科研机构尤其有吸引力。但前沿数学 agent 这条路拼的是万卡级并发推理 + 超长上下文编排,算力门槛仍是国内在这条赛道上最主要的约束。同时,AI 公司在学术伦理上的规则真空(数据使用、署名、成果发布)大概率会被监管提上议程——这既是政策风险,也是国产模型的合规机会窗口。

来源