xAI 於 8 月 11 日釋出新一代大模型 Grok 4.6,官方稱其在同等價格下相較 4.5 實現“重大升級”,並確認模型引數規模為 1.5T。該模型被定位為面向“長期執行的智慧體”和“更具雄心的互動與視覺工作”的升級版本,xAI 同時透露下一代 Grok 4.7 已完成初步訓練,計劃使用 SpaceX 內部資料繼續訓練。
獨立評測機構 Artificial Analysis 將 Grok 4.6 的智慧指數評為 61,大致與 GPT-5.6 Sol Max 相當,略低於 Claude Opus/Fable。在智慧體相關基準上,Grok 4.6 在 Terminal-Bench v2.1 上取得 88.4% 的成績,GDPval-AA v2 Elo 達到 1753,並在 AA-Briefcase 測試中表現出競爭力,而成本遠低於同類模型。早期競技場資料也顯示,其在網頁開發任務上的表現接近 GPT-5.6 Sol 和 Claude Fable。
定價是此次釋出的焦點之一。Artificial Analysis 指出,Grok 4.6 的 API 價格為 每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,顯著低於前沿同類模型。多位從業者立即將其視為編碼和缺陷查詢工作負載的“新預設選擇”,例如 Pawel Huryn 和 Cognition 已在 Devin 中提供該模型。
xAI 表示,效能提升主要來自更長的補充訓練、重新生成的 SFT 軌跡,以及針對編碼、網頁、CAD 和核心最佳化等領域的智慧體強化學習。官方還報告模型在長任務中表現出更多自我測試行為。
在 Grok 4.6 釋出同日,阿里 的 Qwen3.8-Max 也以開放權重形式釋出,總引數 2.4T、啟用引數 95B 的 MoE 架構,社群強調其規模、首日可用性以及長上下文和智慧體導向。vLLM 提供首日支援,併為 NVIDIA B300 和 AMD MI355X 提供廠商特定的 4-bit 檢查點;Together AI 和 Baseten 也宣佈立即支援。不過有使用者指出,初始開放權重版本僅支援文本,暫不支援視覺輸入。
同日,DeepSeek 的 V4 Pro 正式版(GA)上線,定價約為 每百萬輸入 token 0.435 美元、每百萬輸出 token 0.87 美元,有觀察者稱其比 Fable 5 便宜約 57 倍,同時相比預覽版在 Terminal Bench 上提升 15.8%。不過早期使用者反饋其能力並非在所有任務上都明顯領先於 Kimi 或 Flash,暗示 DeepSeek 未來的進步可能更多依賴強化學習環境和智慧體工作,而非單純擴大規模。
微軟 也加入推理模型競爭,Mustafa Suleyman 宣佈推出 MAI-Thinking-1,這是微軟首個“從零構建”的推理模型,現已在 Foundry 中提供。團隊初期請求聚焦於工具使用的反饋,表明微軟將其定位為應用型推理模型,而非單純的基準測試參賽者。此外,Upstage 的 Solar Pro 4 在智慧指數上從 14 躍升至 42,在智慧體和長上下文任務上進步顯著,但仍落後於當前頂級前沿和開放模型。
Grok 4.6 的釋出正值 AI 智慧體(AI teammate)賽道競爭加劇之際。此前 Claude Tag 評價褒貶不一,Block 的 Buzz 則對技術使用者要求較高,市場仍在等待一個明確的品類領導者。xAI 憑藉 Grok 4.6 的價效比和智慧體能力,有望在這一領域佔據一席之地。