1 万个 AI Agent 花 88 小时解出千禧年难题:OpenAI 官宣纳维-斯托克斯方程被拿下,流体真的会”爆掉”

漩涡状流体向内螺旋拉伸形成奇点的示意图,橙色代表高速旋转区域、青色代表低速区域,呼应 OpenAI 纳维-斯托克斯千禧年难题证明中的涡流结构
内容摘要

OpenAI 9 月 8 日官宣:约 1 万个 AI Agent 组成的系统花 88 小时解出纳维-斯托克斯千禧年难题,附 165 页证明与 Lean 机器核验。一文讲清这个 90 年悬案是什么、AI 怎么做到的、与人类数学家的撞车争议,以及你该怎么看待这次"官宣",别急着当定论。

9 月 8 日,OpenAI 扔出一颗深水炸弹:它派出的约 1 万个 AI Agent,花 88 小时解出了纳维-斯托克斯方程——数学界七大千禧年难题之一,悬而未决近 90 年。随公告一起公开的,还有一份 165 页的解析证明和一套 Lean 机器核验文件。OpenAI 同时声明:不打算申领那 100 万美元奖金。

这条新闻的冲击力不在”AI 又变聪明了”,而在于三个第一次:第一次有 AI 系统宣称解决(不是复现、不是辅助)一道开放了 90 年的千禧年难题;第一次用上万 Agent 并行作战完成数学发现;也是第一次,”AI 的证明”要直面整个数学界的审视。

90 年没人答上来的问题:流体到底会不会”爆掉”

先把这个难题讲成人话。纳维-斯托克斯方程是描述流体(空气、水、血液)如何流动的基本方程,飞机设计、天气预报、血流模拟全依赖它。方程本身 19 世纪就有了,但 2000 年 Clay 数学研究所把它列为七大千禧年难题时,问的是一个很基础的问题:

一团一开始平滑流动的流体,会不会在某个时刻突然”爆掉”——速度在有限时间内变得无穷大?

1934 年数学家 Jean Leray 证明了”广义解”存在,但”解是否永远保持光滑”这个核心问题,卡了 90 年。直觉上,真实流体不可能无限快,所以很多人倾向认为”不会爆”;但没人能证明。这次 OpenAI 的 Agent 给出的答案是:会爆。它构造出一个向内螺旋、不断拉长的涡流(像一团被抻长的意大利面),中心区域越缩越快,但整体动能始终有限——速度趋于无穷,能量却不发散,这个微妙的平衡正是证明的难点。

这场”解题”是怎么组织起来的

OpenAI 在官方博客里把过程写得相当细,这里只提炼关键节点:

  • 更聪明的内部模型:8 月 28 日起 OpenAI 在训练一个新模型,官方称它”明显强于已发布的 GPT-6 Astra”,训练至今仍在继续。注意,这个模型没有公开
  • 9 月 1 日启动:OpenAI 听到”两道千禧年难题被解出”的传闻(后来确认与 Anthropic 研究员 Levent Alpöge 和纽约大学数学教授 Tristan Buckmaster 有关),于是派 Agent 分头去试所有未解的千禧年难题。
  • 先用 Euler 方程练手:约 100 个 Agent 花 50 小时先解出了无粘 Euler 方程的正则性问题,OpenAI 觉得方向可行,把资源集中到纳维-斯托克斯。
  • 主力攻坚:解出纳维-斯托克斯的那个小组有约 1 万个并发 Agent,9 月 5 日(周六)出结果,距启动约 88 小时。整个过程 270 万条消息、约 1300 亿输出 token;所有难题加总约 4.9 亿条消息、3000 亿 token。据 WSJ/Axios,算力成本在数百万美元级别。
  • 机器核验:GPT-6 Astra 又花了 17 小时把证明形式化到 Lean 里,逐行机器校验通过。
  • Codex 当”科研管家”:不同 Agent 组探索不同思路,OpenAI 用 Codex 汇总各组最有价值的中间结果再喂回各组——这本身就是一次大型 Agent 编排实验。

撞车争议:和人类数学家撞了题,还撞出了火药味

这事最有意思的部分在幕后。OpenAI 承认,它是 9 月 1 日听到传闻后才启动的,而传闻指向的正是 Alpöge(Anthropic 员工)和 Buckmaster(NYU 教授)——这两人此前已经解决了受迫 Euler 方程的问题(与纳维-斯托克斯相关但不同)。

OpenAI 声称:它解完后主动联系对方提出联合发布、承认对方在 Euler 问题上的优先权,并强调”我们的研究者和 Agent 没有以任何方式看过他们的工作”;但同时也承认”无法排除脱敏数据对模型训练产生影响的可能”。Buckmaster 方面则质疑 OpenAI 是否从他们的私下工作(包括与 OpenAI 产品的交互)中获得了研究方向。双方各执一词,目前没有定论。

还有一个现实:Clay 数学研究所至今仍把纳维-斯托克斯列为未解。按规则,解决方案要在合格刊物发表、公开满两年、并获得数学界普遍认可,奖金才可能兑现。菲尔兹奖得主 Timothy Gowers 的回应很克制:”这无疑是个大时刻”——但数学家们还没开始认真审证明,尤其要核对 Lean 形式化里的定义是否忠实复述了 Clay 原题。

影响分析:这次和”费马核验”不是一回事

上一周老达刚写过 Claude 用 11 天把费马大定理变成机器可核验的证明(Claude 11 天拿下费马大定理),很多读者会问:这俩是不是一回事?不是,差别很关键:

  • 费马大定理早就被人类证明了(Wiles,1995),Claude 做的是把已有证明”机器化”——是核验,不是发现。
  • 纳维-斯托克斯是真·开放问题,七大千禧年难题此前只被人类解出过一道(庞加莱猜想)。这次 AI 声称的是”给出新证明”,性质完全不同。

所以这条新闻真正值得关注的三层影响:

一是 Agent 编排到了新量级。 1 万个 Agent、88 小时不间断协作、270 万条消息、跨组思路汇总再分发——这在一年前是不可想象的。AI 的”群体智能”第一次在真实科研任务上规模化跑通,比单点模型刷分意义大得多。

二是”AI 数学”的信任问题浮出水面。 8 月的 GPT-6 Astra 正式发布已经展示过 Lean 核验;这次问题升级了:谁来核对”形式化定义是否忠实于原题”?机器能验证逻辑,但验证不了”翻译”是否正确。未来 AI 出的证明会越来越多,验证能力会比生成能力更值钱

三是未公开模型 + 数百万美元成本,意味着这离普通人还很远。 但它预告了一件事:OpenAI 手里有个”明显强于 Astra”的模型还没发。参考 Astra 从泄露到官宣的节奏,下一次发布不会太远。

老达点评

说三点看法,带点个人判断(置信度 80% 以上):

  1. 别把”官宣”当”定论”。 数学界的规矩是两年公开期加同行普遍接受才算数。OpenAI 自己都说”不打算申领奖金”,Clay 也还没改状态。这篇新闻的价值在于”AI 第一次宣称解决开放难题”这个节点本身,不在于它是否真的被学界盖章。老达判断:证明大概率有实质内容,但要害在定义忠实度,这是未来几个月数学界的审查重点。
  1. 真正的里程碑是”1 万 Agent 协作 88 小时”,不是解出一道题。 对做 AI 实践的人,这条更值得抄作业:分组探索 → Codex 汇总中间结论 → 再分发 → 多模型接力(新模型攻坚、Astra 做核验)。这套”Agent 科研流水线”的模式,比题目本身更容易迁移到别的复杂任务上。
  1. 警惕”未公开模型”的信息差。 “明显强于 Astra 的内部模型”这种说法,既是预告也是营销。跟不跟、等不等,取决于你要不要做最前沿的数学与推理任务——绝大多数读者不需要,先把手头模型用好更重要。

一句话收尾:AI 能不能”解难题”这件事,从今天起不再是科幻片桥段,而是数学系正在发生的新闻。至于奖金,留给数学界去吵;作为普通人,看懂”验证比生成更值钱”这一条就够了。

相关阅读:

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *