AI 模型市場再度迎來密集釋出潮。xAI 推出 Grok 4.6,Google 帶來 Gemini 3.7 FlashDeepSeek 則釋出 V4 Pro 0813。三家公司的模型幾乎同時登場,圍繞智慧、速度與價格展開激烈競爭。獨立評測網站 Artificial Analysis(AA)的測試結果顯示,三款模型各具特色:Grok 4.6 在智慧與代理型任務上表現突出,Gemini 3.7 Flash 以極致速度見長,而 DeepSeek 則因漲價策略引發熱議。

Grok 4.6:智力躍升,長程代理任務效率優選

作為本輪更新中最受關注的產品,Grok 4.6 的表現令人矚目。據 xAI 介紹,該模型通過更長時間的預訓練,並結合 AI 生成資料與高質量工程資料來強化推理能力;後訓練階段則以 Grok 4.5 為基礎,進行監督式微調與強化學習。AA 評測顯示,Grok 4.6 的智慧指數達到 61 分,與 GPT-5.6 Sol 並列,正式躋身 60 分以上的頂尖模型行列。

價格方面,Grok 4.6 維持了極具競爭力的收費標準:每百萬輸入 token 2 美元、輸出 6 美元。此外,它執行實際任務平均僅需 53 回合、約 5 億個輸入 token,資源消耗顯著低於部分競品,這對於處理長流程代理工作極為有利。

DeepSeek V4 Pro 0813:表現保守,峰谷定價策略惹議

向來以低價高量著稱的 DeepSeek,本次更新卻伴隨漲價聲浪。AA 給予其 53 分的智慧指數,雖優於先前的預覽版,但在同級競品中仍顯保守。儘管在 GPQA Diamond 與 Terminal-Bench v2.1 等測試中表現尚可,且單次任務費用約 6 美分(在 104 個模型中名列第二便宜),但新實施的計費機制卻引發疑慮。

DeepSeek 同步宣佈 API 採用峰谷定價,將北京時間上午 9 點至中午、下午 2 點至 6 點列為高峰時段。在部分情境下,價格最高恐飆升至原先的 12 倍,這讓市場質疑其“平價 AI”的定位是否受到衝擊。

Gemini 3.7 Flash:極致神速,主打開發實用性與均衡配置

Google 推出的 Gemini 3.7 Flash 則將重心放在速度與實用性上。其智慧指數達 56 分(較前代提升 4 分),AA 認為這歸功於代理型任務與程式開發能力的顯著進步。該模型在 DeepSWE v1.1、FrontierCode、WebDev Arena 與 AutomationBench 等多項專業測試中皆有大幅提升。

最引人注目的是其輸出速度飆升至每秒 340 個 token,成為這波新模型中速度最突出的產品。配合 Google 推出的半價策略(至 2026 年底前,維持每百萬輸入 0.75 美元、輸出 3.75 美元),展現了極高的吸引力。

整體而言,這一輪新模型釋出凸顯了 AI 領域競爭形態的轉變:市場不再單純比拼單一分數,而是展開“智慧、代理能力、速度與成本”的綜合考驗。Grok 4.6 專注長程任務的高效能,Gemini 3.7 Flash 以神速與均衡配置取勝,而 DeepSeek 則需在低價優勢與漲價壓力之間尋找新的立足點。