中國大模型在數學推理領域實現里程碑式突破。經國際數學奧林匹克(IMO)官方評定,小紅書自研的dots-note-3.0大模型在2026年IMO中六道題目全部答對,以滿分42分斬獲金牌。這是中國大模型首次獲得IMO官方金牌水平認證,也是繼谷歌Gemini之後,全球第二個達到該成績的大模型。

IMO被譽為數學競賽的“皇冠”,每年吸引全球頂尖中學生參與,題目覆蓋代數、組合、幾何和數論四大方向,每題7分,總分42分。參賽者不僅需給出正確答案,還必須寫出邏輯完整、可接受逐步審查的證明過程。2026年IMO金牌線為29分,較去年的35分下降6分,意味著選手完整解決4道題再加1分即可進入金牌區間,而dots-note-3.0直接拿下滿分,抵達了該試卷能衡量的最高點。

dots-note-3.0的解題方式令人矚目。它僅用自然語言就完成了從讀題、解析到寫證明的全過程,無需像早期模型那樣先將題目翻譯成Lean等形式化語言。在推理過程中,模型採用智慧體方式,結合自然語言與Python程式碼執行來推理解題,並藉助遞迴自我批判能力審視自身論證。

尤其值得關注的是第三題的解法。這是一道組合博弈問題,網上常見解法是將原問題轉化為圖論中的連通性問題再建立證明。但dots-note-3.0沒有沿襲此路,而是轉用歸納法,抓住了問題最本質的結構,設計出恰到好處的歸納物件與歸納命題。多位數學界人士評價其解法“優雅”“每一步都順理成章,但人類選手很難想到從這個角度切入”。

此次參賽採用嚴格的即時新題機制:每個比賽日學生考試結束後,模型團隊才收到當天題目,並須在規定期限內提交PDF答卷。這確保模型無法提前進行針對性訓練,考驗的是模型在真正未知問題出現時,能否獨立理解、探索並完成嚴密推理。

回顧大模型IMO挑戰歷程,2024年穀歌Gemini首次嘗試僅獲28分銀牌,且需將題目形式化、部分題目耗時數天;2025年Gemini Deep Think以自然語言端到端完成證明,用4.5小時解決5道題獲得金牌。小紅書dots-note-3.0此次滿分成績,在解題效率與完整性上更進一步。

數學推理被視為大模型智力與推理能力的試金石。此前,小紅書在基礎模型領域的能力一直缺少公開權威的量化證明。IMO滿分成績單直接表明,小紅書已具備值得行業認真審視的基礎模型能力。在AI產業中,大模型技術能力的推廣主要依賴程式設計數學兩個方向,因為這兩種任務的結果難以靠語言包裝矇混過關,IMO更是其中認可度最高的標杆。

這一突破對AI產業投資者具有多重含義:它驗證了自然語言端到端推理路線的可行性,為數學輔助、科學發現等應用場景打開了想象空間;同時,小紅書在基礎模型領域的實力得到權威背書,可能改變國內AI競爭格局。不過,數學競賽能力與商業應用能力之間仍有距離,模型在真實世界複雜任務中的表現仍需持續觀察。