OpenAI 的旗艦模型 GPT-6 Astra 近日再度成為市場焦點。據外媒整理,這款模型的訓練規模約達 10 萬顆 GPU,推估成本可能高達 5 億至 10 億美元;若後續訓練規模進一步擴大,成本紀錄仍可能再被重新整理。
NVIDIA 執行長 黃仁勳 近期也表示,GPT-6 Astra 象徵人工通用智慧(AGI)時代的來臨。不過,儘管 OpenAI 對 Astra 的能力相當樂觀,最新比較結果顯示,Anthropic 的 Claude Fable 5.1 仍在多項關鍵測試中保持領先。
彙總評測指出,Fable 5.1 在 SWE-bench Pro、Artificial Analysis 的 Intelligence Index、Coding Agent Index 以及 ProofBench v1.1 等專案中仍優於 Astra。另一方面,Astra 在部分任務上展現出較佳的成本效率與速度,尤其在代理式工作流程與 token 使用效率方面,受到開發者關注。
雙方在 API 定價上看似相近,輸入與輸出 token 的標價分別為每百萬 token 10 美元與 50 美元,但實際成本並不完全相同。資料顯示,Astra 的平均任務成本約為 2.57 美元,而 Fable 5.1 約為 6.12 美元;在某些高推理強度的編碼任務中,Astra 也被認為更省時、成本更低。
不過,Fable 5.1 也通過降低快取讀取費用,強化了長上下文與重度代理工作負載的成本優勢。整體來看,這場新一代旗艦模型之爭,已從單純比拼能力,延伸到訓練規模、推理效率與實際使用成本的全面競賽。
值得注意的是,Astra 在 AI 編碼效能上取得了 67 分 的高分,展現出卓越的 token 效率,但仍不及 Fable 5.1。這一對比凸顯了不同模型在特定任務上的差異化優勢,也為開發者選擇模型提供了更多考量維度。
隨著模型能力接近 AGI 門檻,業界對模型評估的維度也在擴充套件,從單純的基準測試成績,到實際任務中的成本與效率,都將影響未來 AI 應用的部署選擇。