OpenAIGPT-6 Astra 在 ulam.ai 的 ErdosBench 上拿下第一。该基准覆盖 226 道受著名 Erdős 问题启发的开放数学问题,Astra 得分 3.23,解出 106 道,其中 43 道完全解决,另有 27 道被证伪。相比之下,GPT-5.6 Sol 在最大推理强度下解出 78 道,得分 3.12。基准开发者 Przemek Chojecki 将其概括为在多项数学研究技能上取得「稳健的 5%–10% 提升」,并指出该基准远未饱和。

值得注意的是,Astra 的数学能力并非专门优化的结果。OpenAI 首席科学家 Jakub Pachocki 在文章《An Alien Mind》中写道,公司相信通过额外投入可以让模型在数学研究上更强,但出于对 递归自我改进(RSI) 与自动化对齐研究的紧迫感,并未将这一方向列为优先事项。换言之,当前最强的数学模型,是其他优先事项的副产品。Pachocki 表示,OpenAI 正把资源投向递归自我改进与未来 AI 系统的安全保障,认为这是持续站在 AI 研究前沿的唯一路径。

这一表态为「尖峰化」的 AI 发展路径提供了佐证。剑桥研究者 Adam Hunt 曾用一张图对比两种可能:主流 AGI 叙事假设模型能力逐步、广泛地提升,直至覆盖所有人类任务;另一种情景则是能力分布日益「尖峰化」——在编程、数学等少数领域极强,而在语言质量、常识或社交推理等方面停滞甚至倒退。Pachocki 的说法意味着,即便是领先实验室,也无法同时在所有方向推进最大进度:能力在被优化的地方增长,强化数学往往意味着在其他地方有所取舍。

在 RSI 优先的背后,是一种期待:模型最终能自行完成这些优化,从而在各领域加速扩展,数学也包括在内。但这一愿景仍面临质疑,包括语言模型是否具备类似人类的创造力、能否实现真正的自我改进。

数学界自身也正同时应对 AI 与内部价值体系的双重冲击。数学家 Terence Tao2026 年国际数学家大会上提出,如果 AI 模型产出证明的速度持续快于人类核验的速度,该领域可能从「证明稀缺」转向「证明过载」,届时关键任务不再是解题,而是判断哪些结果真正重要。Tao 将这一局面比作 20 世纪初数学基础危机级别的价值观与实践挑战。目前最难的数学问题仍未解决,这为学科争取了一些时间,但方向似乎已经确定。

需要说明的是,该文还提到,在 Pachocki 的文章发表后,OpenAI 据报已训练出更强的内部数学模型,RSI 与 AI 安全话题也随之升温。