OpenAI 的 GPT-6 Astra 在第三方基準測試中呈現出截然不同的評價。Epoch AI 綜合超過 50 項測試,給出 169 分,使其在 267 個模型中位列第一;而 Artificial Analysis 在知識、編碼和文本理解測試中給出 61 分,與前任 Sol 持平,並落後於 Anthropic 的 Claude Fable 5.1(66 分)。兩家獨立實驗室各自彙總數十項測試,卻得出相反結論,凸顯當前模型評測的複雜性。
在成本方面,Astra 的 API 定價明顯高於前任:每單位處理文本的費用是 Sol 的 2.5 倍,導致單任務成本比 Sol 高出約 75%。但與 Anthropic 相比,情況反轉——在編碼任務上,Astra 與 Claude Fable 5 得分相同,但單任務成本不到後者一半,原因是其計算效率更高:Astra 所需的計算步驟僅為 Sol 的三分之一、Opus 5 的五分之一。
最引人注目的進展出現在 ARC-AGI-3 基準上。該測試將 AI 置於規則和目標均未說明的陌生遊戲世界中,要求模型通過試錯自行理解。Astra 在此達到 62.7% 的得分,測試成本約 2.6 萬美元;其前任 Sol 僅得 7.78%,Anthropic 的 Claude Opus 5 為 30.16%。ARC Prize 負責人 François Chollet 表示,這一進展速度比他預期的“快兩倍”,並因此將其 AGI 時間預測提前。不過他並未稱此為 AGI 已實現的證據。
值得注意的是,OpenAI 此前報告的 99.9% 得分是在不同條件下取得的——使用了 OpenAI 自建的 harness(推理鏈保持與自動摘要工具)。ARC Prize 測量顯示,該設定下執行速度約為內部 harness 的 3.66 倍,token 消耗減少 49%。ARC Prize 指出,只有 62.7% 這一在內部 harness 上執行的結果才允許跨廠商公平比較,但未來也會公佈廠商 harness 的資料。這種 harness 使用及其帶來的效能提升,此前在 GPT-5.6 Sol 評測時已是 ARC Prize 與 OpenAI 的分歧點。
Astra 的推理成本與思考強度呈反向關係:在標準 ARC 框架下,無推理時成本為 49,791 美元,最高推理時降至 26,098 美元,而得分從 35.2% 升至 62.7%。ARC Prize 解釋,這是因為 Astra 用更少步驟解謎,從而減少模型呼叫和 token。一個異常是“低”推理級別得分僅 17.5%,低於無推理時的表現,ARC Prize 未予置評;但其他基準顯示,Astra 的新架構可能在生成首個 token 前內部迴圈處理,從而無需顯式推理即可解決長程任務。
在效率對比上,人類測試者每 90 分鐘會話獲 115 美元,外加每解一遊戲 5 美元,約 9 次嘗試摺合每遊戲 12.78 美元;若僅按大腦代謝能量折算,ARC Prize 估算為每遊戲 0.067 美分。更有意義的是,Astra 在 OpenAI harness 下,超過 96% 的關卡所用步數少於人類解謎者的中位數,平均略高於一半。
在編碼領域,Astra 在 Coding Agent Index 上得 67 分,token 用量約為 Sol 的三分之一,而 Claude Fable 5.1 以 70 分領先。幻覺率在 AA-Omniscience 上從 92% 降至 51%,但在 GDPval-AA v2 上損失約 80 Elo 點,並在銀行支援、SciCode 和長上下文推理任務上有所退步。
在數學前沿,Epoch AI 報告稱,在 FrontierMath Erdős 測試中,Astra 是唯一在 68 道開放 Erdős 問題中解出兩道並附 Lean 驗證證明的模型,每次嘗試預算 300 美元;另有三個解來自非標準額外執行,消耗超 22 萬美元算力,但 Epoch 表示不計入得分。
Epoch 的細分資料顯示,Astra 與 Fable 5.1 目前在不同領域各領風騷:Astra 在數學、知識和謎題上領先,Fable 5.1 在幾乎所有編碼測試中居首。但 Epoch 目前僅記錄了 Astra 的一個編碼得分,且來自中等推理級別執行。這種評測基礎的不一致,使得直接對比仍需謹慎。