Epoch AI已正式判定,FrontierMath Tier 4这一层级「饱和」——该层级所有题目都至少被AI成功解出过一次。OpenAI公布的GPT-6 Astra成绩为97.6%,虽未直接达到100%,但按Epoch的统计口径,「全部解出」指的是把不同模型、不同时间的尝试累积起来后,Tier 4中每道题都已有过成功解答记录。

这一结果的参照系相当鲜明。Tier 42025年7月11日推出时,榜上最高成绩只有约5%;一年零两个月后,这道曾被视作大模型数学噩梦的防线被跨越。出题人之一、马凯特大学数学副教授Jay Pantone表示,以往AI倾向于寻找数值捷径,而这一次AI的解法与他本人的思路相当接近。他还提到,在GPT-6 Astra近期密集冲击数学问题的背景下,自己已经很难感到惊讶。

FrontierMath本身正是为延缓「被刷穿」而设计的。它最早发布于2024年11月7日,由Epoch AI联合60多位数学家重新设计了一批此前从未公开的原创题,参与者包括陶哲轩、Timothy Gowers、Richard Borcherds等菲尔兹奖得主。陶哲轩当时看过部分研究级题目后称其「极其困难」,并判断最难的Tier 3可能还能让AI卡上几年。

最初的题库共300道题,分Tier 1至Tier 3:Tier 1接近高难度本科题与数学奥赛但允许使用更高级工具,Tier 2为高年级研究生难度,Tier 3接近博士生早期的探索性研究问题。随着推理模型出现,前三层逐渐不够用,Epoch于2025年增设Tier 4。这一层多由数学教授和博士后设计,每人围绕自己的研究方向做数周短期研究,再把成果压缩成一道可自动验证的问题,最初收录50道题,覆盖分析、数论、组合数学、拓扑、代数几何等方向。发布之初,所有模型历次测试加起来也只有3道题曾被解出,且解答依赖了一些正确但未被充分论证的假设。Epoch一度在公开样题页面写道,其中一些题可能几十年都不会被AI解决。

题库自身也开始经不起AI「拷打」。Epoch随后启动独立审计,先用GPT-5.5Claude Opus 4.7筛查疑点,再交由数学家逐题复核,最终于2026年6月推出v2版本:Tier 4修正12道题、移除7道题,留下43题。在v2口径下,GPT-5.6 Sol做到83.0%Claude Fable 5达到90.2%,GPT-6 Astra则来到97.6%。

需要区分的是,Tier 4饱和并不等于「数学已经被AI解决」。FrontierMath项目已向下一阶段延伸:除Tiers 1-4外,新增了真正的Open Problems,直接以数学界尚未解决的研究问题考察模型;以及FrontierMath Erdős,把Erdős开放问题形式化进Lean,要求AI写出能通过形式化验证的完整证明。在FrontierMath Erdős的68道问题中,Astra此次只解决了2道

从产业视角看,这条消息的价值不在于某一道题被解出,而在于评测基准的生命周期正在明显缩短:一个专门为最强模型设计、由顶尖数学家出题的研究级测试,从「可能几十年无解」到被判定饱和只用了一年多。对关注模型能力曲线的投资者而言,这意味着两件事——一是头部模型在需要长链条推理的任务上迭代速度仍快,二是评测的「天花板」正从答案已知的难题,转向答案未知的开放问题与可形式化验证的证明,后者的难度与验证成本都更高。相关能力若外溢到代码、科研与工程场景,将影响算力需求结构与模型厂商的竞争叙事;但Tier 4饱和本身只说明该基准失效,并不构成对任何公司或产品的估值结论。