中国大模型在数学推理领域实现里程碑式突破。经国际数学奥林匹克(IMO)官方评定,小红书自研的dots-note-3.0大模型在2026年IMO中六道题目全部答对,以满分42分斩获金牌。这是中国大模型首次获得IMO官方金牌水平认证,也是继谷歌Gemini之后,全球第二个达到该成绩的大模型。

IMO被誉为数学竞赛的“皇冠”,每年吸引全球顶尖中学生参与,题目覆盖代数、组合、几何和数论四大方向,每题7分,总分42分。参赛者不仅需给出正确答案,还必须写出逻辑完整、可接受逐步审查的证明过程。2026年IMO金牌线为29分,较去年的35分下降6分,意味着选手完整解决4道题再加1分即可进入金牌区间,而dots-note-3.0直接拿下满分,抵达了该试卷能衡量的最高点。

dots-note-3.0的解题方式令人瞩目。它仅用自然语言就完成了从读题、解析到写证明的全过程,无需像早期模型那样先将题目翻译成Lean等形式化语言。在推理过程中,模型采用智能体方式,结合自然语言与Python代码执行来推理解题,并借助递归自我批判能力审视自身论证。

尤其值得关注的是第三题的解法。这是一道组合博弈问题,网上常见解法是将原问题转化为图论中的连通性问题再建立证明。但dots-note-3.0没有沿袭此路,而是转用归纳法,抓住了问题最本质的结构,设计出恰到好处的归纳对象与归纳命题。多位数学界人士评价其解法“优雅”“每一步都顺理成章,但人类选手很难想到从这个角度切入”。

此次参赛采用严格的实时新题机制:每个比赛日学生考试结束后,模型团队才收到当天题目,并须在规定期限内提交PDF答卷。这确保模型无法提前进行针对性训练,考验的是模型在真正未知问题出现时,能否独立理解、探索并完成严密推理。

回顾大模型IMO挑战历程,2024年谷歌Gemini首次尝试仅获28分银牌,且需将题目形式化、部分题目耗时数天;2025年Gemini Deep Think以自然语言端到端完成证明,用4.5小时解决5道题获得金牌。小红书dots-note-3.0此次满分成绩,在解题效率与完整性上更进一步。

数学推理被视为大模型智力与推理能力的试金石。此前,小红书在基础模型领域的能力一直缺少公开权威的量化证明。IMO满分成绩单直接表明,小红书已具备值得行业认真审视的基础模型能力。在AI产业中,大模型技术能力的推广主要依赖编程数学两个方向,因为这两种任务的结果难以靠语言包装蒙混过关,IMO更是其中认可度最高的标杆。

这一突破对AI产业投资者具有多重含义:它验证了自然语言端到端推理路线的可行性,为数学辅助、科学发现等应用场景打开了想象空间;同时,小红书在基础模型领域的实力得到权威背书,可能改变国内AI竞争格局。不过,数学竞赛能力与商业应用能力之间仍有距离,模型在真实世界复杂任务中的表现仍需持续观察。