9 月 8 日,OpenAI 公布了一套针对纳维-斯托克斯(Navier–Stokes)方程千禧年问题的有限时间奇点构造。按其给出的结果,这套构造能够让三维流体在光滑外力和有限动能条件下,演化到局部速度无界。执行层面,一个仍在训练中的内部模型配合约 1 万个 Agent 持续搜索约 88 小时,随后又用形式化工具 Lean 完成验证。
消息公布后迅速引发争论。航空航天工程教授 Chris Combs 提醒,这并不等于得到一套可以直接计算任意流体运动的通用解法,对现有 CFD(计算流体力学)工作也不会立刻产生明显变化。数学侧的讨论焦点则是三维光滑解能否一直维持正则性,而有限时间 blow-up 本身就正面击中了这一命题。与此同时,纽约大学数学家 Tristan Buckmaster 与 Anthropic 研究员 Levent Alpöge 的相近研究也被卷入讨论,使事件多了一层研究路线与成果来源的争议。
要理解这次工作的技术分量,需要先厘清一个容易被模糊的事实:AI 并没有凭空顿悟流体力学的终极奥秘,它更像是把人类数学家的破局思路做了大规模加速。据雷锋网报道,人类数学家贡献的是「搭骨架」与物理直觉——纳维-斯托克斯的难点在于非线性放大与黏性耗散的冲突,人类提出了故意偏离临界尺度、高频振荡脉冲、剥离局部速度与整体动能等结构,这类从 0 到 1 的跳跃性几何直觉,目前 AI 仍难以独立完成。OpenAI 的万级 Agent 承担的则是「填血肉」:证明需要同时满足自相似尺度、局部剪切、应力锥等数十个互相牵制的高维非凸约束,人类可能耗费数年试错,而 Agent 在 88 小时内穷尽了可能分支,从庞杂假设空间中搜出一套能整体闭合的构造。最后,Lean 与 Comparator 负责「防幻觉」——Lean 把证明钉进逻辑系统,Comparator 用独立形式化的命题检查目标表述是否仍对应原始问题。
技术细节上,奇点构造的关键是故意偏离临界尺度。纳维-斯托克斯的麻烦在于非线性放大和黏性耗散会同时随尺度缩小而增强:涡量拉伸把流动压向更细结构,黏性恰好对高频结构作用更强,两边强度稍有偏差,要么奇点被耗散抹平,要么能量、压力和外力一起失控。OpenAI 的做法不是找旋转更快的流场,而是设计一套各向异性的自相似尺度:从轴对称带旋流的涡核出发,接近奇点时涡核径向快速收缩、轴向也收缩但略慢,核心逐渐变成一根越来越细长的旋转流体柱。真正关键的是引入一个很小的指数偏置,让三个方向不按同一尺度变化——局部速度可以走向无界,而高速区域体积缩小得更快,整体动能仍受控制;黏性也没有被排除,而是被限制在特定方向承担稳定结构的作用。
更困难的一步是残差处理。内部自相似涡核接到由黏性扩散控制的外部流场后,两者之间留下环形过渡区,动量残差集中于此。若直接把这些残差定义为外力,外力本身可能随奇点临近而失控。于是证明需要完成一个更苛刻的转换:把本应由外力承担的误差,转化成流体内部细尺度运动自己产生的动量输运。这正是高频振荡脉冲出现的原因——脉冲平均速度很小,不改变背景流,但非线性二次耦合会留下稳定的平均动量通量,即雷诺应力。系统可以先计算背景流缺少什么方向的动量输运,再反过来设计振荡生成对应有效应力。不同振荡模式能制造的动量通量比例受限,几类波形组合只能覆盖一个特定的应力锥,目标残差必须落在锥体内部;若跑到锥体外,增加振幅没有意义,因为缺失的是方向而非强度。这反过来要求用小振幅、高频率的径向微扰调整局部剪切,再用低频修正补回被破坏的径向矩条件,形成高频改局部、低频维护整体的多尺度分工。
这也是为什么该问题对单线程推理极不友好:系统要同时决定自相似尺度、轴对称剖面、轴附近延拓方式、外部流场、局部剪切、应力锥、径向矩条件、振荡模式与高阶修正,变量之间并非局部独立,一处修改往往在很后面才暴露代价。多 Agent 系统的价值在于同时维持大量不同候选结构,有的搜剖面、有的试参数、有的检查应力方向、有的追踪某条路线为何失败,失败因此变成新的约束信息。OpenAI 还把接近 100 个 Agent 放到相邻的 Euler 问题上,先单独暴露非线性奇点结构,再把中间几何与构造思路迁回纳维-斯托克斯路线。据雷锋网报道,该路线最终产生约 270 万条 Agent 消息和 1300 亿 输出 token,其中大量内容不会进入最终证明,但承担了参数试验、失败构造与中间引理搜索。
验证环节同样值得关注。当搜索规模膨胀到百万级推理轨迹,验证成本迅速上升,多尺度构造涉及大量函数空间、边界行为与正则性条件,自然语言里漏掉一个前提或量词在长链推导中发生变化,结论就可能已不是原命题。Lean 的作用是把隐藏条件显式拉进形式系统;Comparator 则约束命题边界,防止系统在推导中悄悄弱化原始条件。两层合在一起,才构成大规模 AI 数学搜索所需的验证出口。
从产业视角看,这次工作的看点或许不在某个孤立技巧,而在于「构造—搜索—修正—验证」能否被拆解成一套可复用的研究系统。若这套范式能迁移到其他开放难题,意味着前沿模型的能力评估标准可能从单次问答转向长时程、多 Agent 协同的工程化搜索,而这背后对应的是可观的推理算力消耗。不过,围绕成果来源与优先权的争议也提醒市场:AI 在数学发现中的角色目前更接近加速器与验证器,人类直觉仍是不可替代的起点,对其能力边界的判断需要保持审慎。