Anthropic 的旗艦模型 Claude Opus 5 在 ARC-AGI-3 基準測試中取得了 30.2% 的得分,大幅超越此前由 OpenAI GPT-5.6 Sol(Max)保持的 7.8% 紀錄,也領先於 Anthropic 自家的 Fable 系列模型(得分約 20%)。這一測試由 ARC Prize 團隊設計,旨在評估 AI 模型解決訓練中未曾見過的新任務的能力,這些任務通常對人類來說也頗具挑戰。測試以類似遊戲的形式進行,模型需要推斷互動環境的規則、規劃行動並逐步執行,從而檢驗其通用推理能力而非記憶儲存的知識。
ARC Prize 團隊的分析指出,Opus 5 的領先優勢源於其更強的邏輯推理能力,這使得模型能在不熟悉的環境中進行更自主的探索、規劃與執行。在測試過程中,研究人員還觀察到了此前從未在其他模型中出現過的行為:Opus 5 能夠將任務轉化為代數符號表示,並獨立推匯出反射方程。此外,該模型成功解決了 25 個公共演示環境中的 6 個,其中 5 個是此前未被任何模型攻克的,且其中 4 個達到或超過了人類水平。
在更早版本的 ARC-AGI-1 和 ARC-AGI-2 基準測試上,Opus 5 分別取得了 97.5% 和 90.4% 的得分,與之前的最佳成績持平,但 ARC Prize 指出其計算成本略有上升。
儘管在 ARC-AGI-3 上表現突出,但獨立測試顯示其提升可能並非在所有領域都如此顯著。在 Guanghan Ning 設計的私人互動式解謎基準測試 Witness 上,Opus 5 得分為 43.4,與 Kimi K3 和 Fable 5 在統計上不相上下,且相比 Opus 4.8 的提升幅度遠小於其在 ARC-AGI-3 上的表現。Ning 認為,這一模式符合針對特定型別資料進行訓練的特徵,但 Witness 測試無法確定 Anthropic 具體使用了哪些資料。
對此,ARC-AGI-3 的研究者之一 Greg Kamradt 表示,單一測試的較弱結果並不能否定模型整體的推理能力提升,因為基於熟悉機制的測試可能無法充分檢驗模型對新奇事物的適應能力。Ning 後來也澄清,Opus 5 確實在 Witness 上展現了一定的泛化能力,只是程度遠不及在 ARC-AGI-3 上。
Anthropic 並未詳細解釋 Opus 5 取得如此進步的原因。業界推測,針對性的資料標註和強化學習可能是關鍵因素。由於 Opus 5 是在 ARC-AGI-3 測試及其格式公開後開發的,Anthropic 可能針對該測試的技能和謎題格式進行了最佳化,但這並不意味著公司直接訓練了具體的測試任務。標註人員可能為類似謎題標註了推理軌跡、有效行動、失敗嘗試和恢復步驟,而強化學習則可能獎勵了探索、規劃、規則發現和自我糾正等行為。
Ning 將這一過程類比為程式設計基準測試的演變:從 HumanEval 等飽和的基準,到頻繁更新的競賽,再到如今的程式設計智慧體。ARC-AGI-3 作為互動式推理的重要目標,很可能首先吸引了最多的訓練投入,而覆蓋更多邊緣案例則有助於模型泛化到更廣泛的抽象推理任務。