英伟达于 9 月 9 日公开了 Nemotron 3 Ultra 在 2026 年国际数学奥林匹克(IMO)中使用的整套数学推理系统。该系统最终获得 30/42 分,超过当届 29 分的金牌线。整个比赛过程中,模型仅用自然语言书写证明,没有调用 Lean 等形式化证明器,也没有借助外部工具或联网检索。
与成绩一同发布的,是支撑这 30 分的完整技术链路:两个数学专家 checkpoint、SFT 与 RL 训练数据、推理代码、训练配方、比赛提交证明,以及 200 道新的 Nemotron-IMO-Bench。换言之,英伟达公开的不是一个更强的数学模型,而是一套从训练到比赛推理的系统。Nemotron 3 Ultra 只是底座,两个专家模型、大规模证明搜索、模型验证与多轮改写共同构成了把成绩推到金牌线的完整链路。
这一开源动作发生在特殊的时间节点。两天后的 9 月 11 日,陶哲轩、Peter Scholze、Maryna Viazovska 等 25 位菲尔兹奖得主联合发声,批评 AI 数学成果发布越来越快,而证明检查、方法梳理和复现往往没有足够时间展开。在这样的背景下,英伟达把一个 IMO 金牌级结果背后的模型、数据、推理流程和计算成本都留了下来,在学术圈较为少见。
系统的技术起点,是英伟达没有对同一个 Nemotron 3 Ultra 反复采样,而是先训练了两个行为明显不同的数学专家。SFT 数据中除了完整证明,还加入了大量证明修改、验证和再次验证的轨迹,使模型不仅学会从题目生成证明,还能在拿到一份写了一半甚至局部有误的证明后,判断问题所在并沿原路线继续修补。RL 专家则处理另一层问题:改变证明路线被抽中的概率。IMO 级题目的证明空间非常稀疏,正确组合只占生成分布中很小的一部分,强化学习根据成功与失败轨迹重新调整生成分布,让能完整闭合的思路获得更高权重。
通用版、SFT 和 RL 三份 checkpoint 由此形成三种不同的解题偏好。如果同一个模型连续生成 200 份证明,其中大部分围绕同几种构造打转,那么 200 份文本并不等于 200 条独立路线。加入经过不同后训练的 checkpoint,相当于主动改变采样分布,让计算资源进入另一片证明空间。英伟达的实验显示,继续增加同一个 RL 模型的采样,收益很快放缓;把 SFT 专家加入后,即使生成预算接近,能够覆盖的问题明显增加。
在首轮生成中,系统会为每道题生成 384 份证明,但这些答案本身并非核心。系统把这些证明放进一个持续更新的搜索池,每份证明经过验证后分为直接通过、方向可用但需修补、路线价值较低三类。评分较高的证明被留下,验证器指出的问题被送回模型继续修改。这种 proof pool 保留了历史计算,一条路线走到什么位置、哪里出了问题、哪些部分仍可用,都会成为下一轮搜索的输入。多轮改写因此不是反复润色同一篇答案,而是每轮重新产生多个候选,再次进入全局证明池竞争。
验证环节的设计同样关键。英伟达把接受门槛设得很高:两个专家反复检查同一份证明,只有所有判断全部通过,候选才会被接受。这一设计以较高的误拒率换取更低的错误接受率。但实验暴露出更深层的困难:SFT、RL 和通用版虽然经过不同后训练,却共享同一个 Nemotron 3 Ultra 底座,拥有大量相似的知识结构、概念表示和推理习惯。当错误来自随机疏忽时,多次检查可以降低风险;当错误来自几个模型共同拥有的理解盲区时,增加检查次数的效果就会明显减弱。论文中一份列置换对称性的错误证明就是典型例子:证明本身存在可明确构造的反例,但三个 checkpoint 反复判断,没有一个识别出关键漏洞。
第 6 题的情况则从另一边说明问题。系统继续投入大量计算后得到一份新证明,内部验证没有放行,但人工复核认为其中包含相当部分正确内容,可以拿到部分分数。这意味着 verifier 同时存在两类偏差:错误证明可能因共享盲区被高置信度放过,有价值证明又可能因门槛过于保守被压下去。因此,这条路线后面面对的并不只是训练一个更强的数学裁判,而是怎样让不同验证组件拥有尽量不同的错误来源。
从开源的实际效果看,两个专家 checkpoint、SFT 与 RL 数据、推理代码、RL recipe、提交证明和 200 道 Nemotron-IMO-Bench 放出后,30/42 可以被还原成一组具体的系统变量。外部团队可以改变 checkpoint 组合、sampling budget、verifier threshold 和 refinement 深度,再看成绩如何变化。但这与完整重跑 30 分仍是两回事:550B 级模型、TB 级显存以及数千个 GB200 GPU 小时依然构成很高的硬件门槛;Nemotron 3 Ultra 通用版自身的完整后训练链也没有做到逐阶段复刻,英伟达官方文档明确写明,部分中间 teacher 和 MOPD checkpoint 尚未开放。
有分析将这套打法形容为 AI 时代的「推恩令」:通过开源让全球实验室分享 IMO 金牌的红利,却也让参与者进入由英伟达硬件定义的搜索推理范式。代码平权已经实现,但算力主权仍集中在少数巨头手中。对基础研究而言,这套系统传递的信号是:算力可以完成最脏最累的体力活,但关于真理的最终裁决、关于验证逻辑的一致性,仍需仰仗人类的直觉。