xAI 於 8 月 12 日釋出新一代模型 Grok 4.6,在 Artificial Analysis 智慧指數(AA Index)上獲得 61 分,與 OpenAI 的 GPT-5.6 Sol 持平,僅落後於 Anthropic 的 Claude Opus 5(63 分)和 Claude Fable 5(62 分)。這一成績較前代 Grok 4.5 提升了 5 分,標誌著 xAI 首次躋身頂級模型行列。

Grok 4.6 在代理任務(agentic tasks)上表現尤為突出。在旨在衡量計算機上真實知識工作的 GDPval-AA v2 基準測試中,該模型以 1753 的 Elo 評分排名第二,僅次於 Claude Opus 5。它完成複雜任務平均只需約 53 步,而 Claude Opus 5 需要約 103 步,效率近乎翻倍。

定價方面,Grok 4.6 保持每百萬 token 輸入 2 美元、輸出 6 美元的價格,比 Claude Opus 5(5/25 美元)和 GPT-5.6 Sol(5/30 美元)便宜超過 60%。這一價格優勢使其成為目前價效比最高的前沿模型之一。

Grok 4.6 現已通過 API、Cursor、Grok Build 以及 OpenRouter、Vercel、Cloudflare 等合作伙伴提供。為吸引開發者,xAI 在釋出首周為 Grok Build 和 Cursor 使用者提供雙倍使用配額。

此次釋出正值 AI 模型競爭白熱化階段。OpenAI、Anthropic 和 xAI 均在加速迭代,試圖在效能和成本之間取得平衡。Grok 4.6 的定價策略可能迫使競爭對手重新考慮其價格體系,尤其是對成本敏感的開發者群體而言,價效比將成為重要考量。

從產業鏈角度看,模型層競爭加劇對下游應用開發者是利好,他們能以更低成本獲得接近頂尖水平的模型能力。同時,這也對算力基礎設施提出更高要求,因為高效完成代理任務意味著更少的推理步驟,但模型訓練和部署的算力消耗仍是關鍵成本。

值得注意的是,AA Index 綜合了多項基準測試,Grok 4.6 的 61 分雖與 GPT-5.6 Sol 持平,但在不同任務上的表現各有優劣。例如在代理任務上,Grok 4.6 的步驟效率顯著優於 Claude Opus 5,但在整體指數上仍略遜一籌。這表明各模型在不同場景下各有優勢,開發者需根據實際需求選擇。

xAI 尚未公佈 Grok 4.6 的具體訓練細節或引數量,但其快速追趕的勢頭已引起市場關注。隨著 Grok 系列持續迭代,AI 模型市場的競爭格局可能進一步生變,價格戰或將成為常態。