OpenAIGPT-6 Astra 在 ulam.ai 的 ErdosBench 上拿下第一。該基準覆蓋 226 道受著名 Erdős 問題啟發的開放數學問題,Astra 得分 3.23,解出 106 道,其中 43 道完全解決,另有 27 道被證偽。相比之下,GPT-5.6 Sol 在最大推理強度下解出 78 道,得分 3.12。基準開發者 Przemek Chojecki 將其概括為在多項數學研究技能上取得「穩健的 5%–10% 提升」,並指出該基準遠未飽和。

值得注意的是,Astra 的數學能力並非專門最佳化的結果。OpenAI 首席科學家 Jakub Pachocki 在文章《An Alien Mind》中寫道,公司相信通過額外投入可以讓模型在數學研究上更強,但出於對 遞迴自我改進(RSI) 與自動化對齊研究的緊迫感,並未將這一方向列為優先事項。換言之,當前最強的數學模型,是其他優先事項的副產品。Pachocki 表示,OpenAI 正把資源投向遞迴自我改進與未來 AI 系統的安全保障,認為這是持續站在 AI 研究前沿的唯一路徑。

這一表態為「尖峰化」的 AI 發展路徑提供了佐證。劍橋研究者 Adam Hunt 曾用一張圖對比兩種可能:主流 AGI 敘事假設模型能力逐步、廣泛地提升,直至覆蓋所有人類任務;另一種情景則是能力分佈日益「尖峰化」——在程式設計、數學等少數領域極強,而在語言質量、常識或社交推理等方面停滯甚至倒退。Pachocki 的說法意味著,即便是領先實驗室,也無法同時在所有方向推進最大進度:能力在被最佳化的地方增長,強化數學往往意味著在其他地方有所取捨。

在 RSI 優先的背後,是一種期待:模型最終能自行完成這些最佳化,從而在各領域加速擴充套件,數學也包括在內。但這一願景仍面臨質疑,包括語言模型是否具備類似人類的創造力、能否實現真正的自我改進。

數學界自身也正同時應對 AI 與內部價值體系的雙重衝擊。數學家 Terence Tao2026 年國際數學家大會上提出,如果 AI 模型產出證明的速度持續快於人類核驗的速度,該領域可能從「證明稀缺」轉向「證明過載」,屆時關鍵任務不再是解題,而是判斷哪些結果真正重要。Tao 將這一局面比作 20 世紀初數學基礎危機級別的價值觀與實踐挑戰。目前最難的數學問題仍未解決,這為學科爭取了一些時間,但方向似乎已經確定。

需要說明的是,該文還提到,在 Pachocki 的文章發表後,OpenAI 據報已訓練出更強的內部數學模型,RSI 與 AI 安全話題也隨之升溫。