Epoch AI已正式判定,FrontierMath Tier 4這一層級「飽和」——該層級所有題目都至少被AI成功解出過一次。OpenAI公佈的GPT-6 Astra成績為97.6%,雖未直接達到100%,但按Epoch的統計口徑,「全部解出」指的是把不同模型、不同時間的嘗試累積起來後,Tier 4中每道題都已有過成功解答記錄。
這一結果的參照系相當鮮明。Tier 4於2025年7月11日推出時,榜上最高成績只有約5%;一年零兩個月後,這道曾被視作大模型數學噩夢的防線被跨越。出題人之一、馬凱特大學數學副教授Jay Pantone表示,以往AI傾向於尋找數值捷徑,而這一次AI的解法與他本人的思路相當接近。他還提到,在GPT-6 Astra近期密集衝擊數學問題的背景下,自己已經很難感到驚訝。
FrontierMath本身正是為延緩「被刷穿」而設計的。它最早釋出於2024年11月7日,由Epoch AI聯合60多位數學家重新設計了一批此前從未公開的原創題,參與者包括陶哲軒、Timothy Gowers、Richard Borcherds等菲爾茲獎得主。陶哲軒當時看過部分研究級題目後稱其「極其困難」,並判斷最難的Tier 3可能還能讓AI卡上幾年。
最初的題庫共300道題,分Tier 1至Tier 3:Tier 1接近高難度本科題與數學奧賽但允許使用更高階工具,Tier 2為高年級研究生難度,Tier 3接近博士生早期的探索性研究問題。隨著推理模型出現,前三層逐漸不夠用,Epoch於2025年增設Tier 4。這一層多由數學教授和博士後設計,每人圍繞自己的研究方向做數週短期研究,再把成果壓縮成一道可自動驗證的問題,最初收錄50道題,覆蓋分析、數論、組合數學、拓撲、代數幾何等方向。釋出之初,所有模型歷次測試加起來也只有3道題曾被解出,且解答依賴了一些正確但未被充分論證的假設。Epoch一度在公開樣題頁面寫道,其中一些題可能幾十年都不會被AI解決。
題庫自身也開始經不起AI「拷打」。Epoch隨後啟動獨立審計,先用GPT-5.5和Claude Opus 4.7篩查疑點,再交由數學家逐題複核,最終於2026年6月推出v2版本:Tier 4修正12道題、移除7道題,留下43題。在v2口徑下,GPT-5.6 Sol做到83.0%,Claude Fable 5達到90.2%,GPT-6 Astra則來到97.6%。
需要區分的是,Tier 4飽和並不等於「數學已經被AI解決」。FrontierMath專案已向下一階段延伸:除Tiers 1-4外,新增了真正的Open Problems,直接以數學界尚未解決的研究問題考察模型;以及FrontierMath Erdős,把Erdős開放問題形式化進Lean,要求AI寫出能通過形式化驗證的完整證明。在FrontierMath Erdős的68道問題中,Astra此次只解決了2道。
從產業視角看,這條訊息的價值不在於某一道題被解出,而在於評測基準的生命週期正在明顯縮短:一個專門為最強模型設計、由頂尖數學家出題的研究級測試,從「可能幾十年無解」到被判定飽和只用了一年多。對關注模型能力曲線的投資者而言,這意味著兩件事——一是頭部模型在需要長鏈條推理的任務上迭代速度仍快,二是評測的「天花板」正從答案已知的難題,轉向答案未知的開放問題與可形式化驗證的證明,後者的難度與驗證成本都更高。相關能力若外溢到程式碼、科研與工程場景,將影響算力需求結構與模型廠商的競爭敘事;但Tier 4飽和本身只說明該基準失效,並不構成對任何公司或產品的估值結論。