OpenAI 近日公佈其 GPT-5.6 Sol 模型在 ARC-AGI-3 邏輯基準測試中的成績,聲稱以 38.3% 的得分超過了 Anthropic Claude Opus 5 此前創下的 30.2% 紀錄。然而,這一成績是在 OpenAI 自有的測試環境下取得,而非官方標準環境,引發了關於基準測試方法論的討論。

在官方標準測試環境中,GPT-5.6 Sol 的得分僅為 7.8%,遠低於 Opus 5 的 30.2%。OpenAI 使用的是其 Responses API,並啟用了 “Retained Reasoning”“Compaction” 兩項設定。前者允許模型在多個步驟之間保留推理鏈,後者則通過總結舊上下文而非直接截斷來保持資訊連續性。在官方環境中,模型的推理過程在每次操作後即被丟棄,導致得分大幅下降。

OpenAI 認為,基準測試不應僅衡量模型本身,也應考慮其執行的技術設定。這一觀點有其合理性,但 ARC-AGI-3 的設計初衷正是為了測試純模型效能,排除外部輔助。Anthropic 的 Opus 5 正是在這一約束下取得了 30% 的得分,且若在 Claude Code 環境下執行,其成績可能更高。

這一事件反映了 AI 行業在模型效能評估上的分歧。隨著模型能力不斷提升,基準測試的標準化和可比性變得愈發重要。對於投資者而言,理解不同測試環境對結果的影響,有助於更準確地評估各公司的技術進展。OpenAI 與 Anthropic 在 ARC-AGI-3 上的競爭,也凸顯了邏輯推理能力作為 AI 模型關鍵指標的日益重要性。