谷歌於 9 月 2 日釋出 Gemini 3.8 Flash,官方定價維持輸入每百萬 token 0.75 美元、輸出 3.75 美元,但第三方機構 Artificial Analysis 當天實測發現,完成同一任務的總成本上升約 40%,原因是模型單任務輸出 token 消耗增加約 30%。價格表未動,賬單卻悄然變厚,這背後折射出大模型競爭正從“每 token 價格”切換到“每任務成本”的新階段。
Gemini 3.8 Flash 是谷歌在 43 天內推出的第三款 Flash 模型:3.6 於七月下旬釋出,3.7 於八月十三日,3.8 於九月二日。谷歌 CEO 皮查伊曾在財報電話會上表示,Flash 的目標是儘量接近月更節奏。該模型在多項基準測試中表現亮眼:DeepSWE v1.1 長週期軟體工程得分 73.7%,距離 Claude Opus 5 的 74.0% 僅差 0.3 分;HLE-Verified 綜合推理得分 54.9%,高於 Opus 5 的 54.4% 和 GPT-5.6 Sol 的 54.5%;Vals 金融智慧體得分 61.4% 排名第一;生成速度約 305 token/秒,是獨立機構測過最快的商用模型。定價方面,當前優惠價輸入 0.75 美元、輸出 3.75 美元每百萬 token,有效期至 12 月 31 日,作為參照,Opus 5 為 5 美元/25 美元,GPT-5.6 Sol 為 4 美元/20 美元。模型現已進入 Gemini App、AI Studio 和 Antigravity 程式設計平台,Cursor、Vercel 等開發工具在釋出當天完成接入。
技術機制上,谷歌稱模型會“更努力地完成任務”,即提升 agentic 推理深度,面對複雜任務執行更多推理步驟、更頻繁地迭代呼叫工具。每一步都跑測試、查輸出,最終答案的錯誤率被壓下去,但每一輪“推理-工具-驗證”迴圈都消耗輸出 token,步驟翻倍,token 消耗自然上升。Artificial Analysis 測出的數字鏈條完整:單任務輸出 token 增加約 30%,折算成單任務總成本上升約 40%。即便漲完,單任務約 0.58 美元的成本仍落在“智慧-成本”價效比前沿上,高推理檔綜合智慧指數 59 分,比上代提高 3 分。另一層價格變化在明年:優惠價到期後,單價將翻倍至輸入 1.50 美元、輸出 7.50 美元。用量漲一輪、單價再漲一輪,兩波疊加才是完整的價格路徑。谷歌同時保留 3.7 Flash 作為低成本選項,承諾繼續支援。
Flash 系列的升級節奏指向開發者入口的爭奪。程式設計 Agent 和自動化工作流是當前 token 消耗增長最快的場景,也是各家 API 收入的主戰場。這個場景的採購邏輯很現實:單位智慧成本誰低用誰,遷移成本極低。DeepSWE 追到離 Opus 5 只差 0.3 分、價格不到六分之一,等於直接把“旗艦級程式設計能力”的商品價格打穿了一個量級。同天釋出的 Gemini 3.8 Flash Cyber 則補了另一條戰線:CWE-Bench 漏洞修復得分 47.2%,與領跑的 Fable 5 基本持平;Chrome 安全團隊實測其有效補丁產出是更大商業模型的 2.6 倍;Wiz 內部滲透測試召回率高出 7.5 到 9.7 個百分點,同等成績花費僅為競對的 1/2.3 到 1/5.2。這個版本不公開售賣,只通過 Fairwind 計劃向約 650 家受信機構開放,與 Anthropic 把 Mythos 5.1 鎖進可信訪問計劃的門控邏輯一致。前沿網安能力正在變成需要資質稽核的戰略資源。
合理推演是,谷歌的賬算在規模上:Flash 承擔開發者生態的走量任務,把使用習慣和工具鏈鎖定在自家平台上,Pro 級別的利潤款可以等能力差距真正拉開再發。這也解釋了為什麼六月預告的 Gemini 3.5 Pro 至今沒有釋出——Flash 太強,Pro 的價格錨點立不住。
基準口徑的邊界需要先講清。官方主打的四個基準全部領先,但第三方核對了完整榜單後,畫面並不均勻。開放式 Agent 任務是明顯短板:Terminal-Bench 4.0 上 Opus 5 拿到 51.8%,3.8 Flash 只有 19.1%;OSWorld 電腦操作 75.4% 對 59.0%。Harvey 法律基準上 10.0% 的“領先”,實際是全榜模型集體不及格下的相對值。規律大致是:邊界清晰、終點明確的專業任務,它能貼著旗艦打;需要自主規劃下一步的開放任務,差距會被拉開。沃頓教授 Ethan Mollick 的初步評價是“一個很好的 Flash 模型,但並不等於前沿模型”。另外,所有對比資料均為廠商自測口徑,釋出日基準與生產環境表現歷來存在差距。成本側的實際影響也取決於任務結構:短問答場景幾乎不受 token 放大影響,長鏈路 Agent 任務才是成本上升的重災區。社群傳聞稱部分團隊已在評估回遷 3.7 Flash 控制預算,尚無官方資料印證。
這次釋出可以確認的產品事實是:Flash 系列的迭代週期壓縮到三週級,能力觸及旗艦邊緣,網安版本進入資質門控。更值得注意的是成本競爭口徑的遷移。當各家每 token 單價逐漸咬平,“完成一個任務燒多少 token”就成了新的定價槓桿——推理更深、步驟更多的模型天然更貴,即便價目表一動不動。Anthropic 兩天前把快取讀取價砍了 75%,打的也是同一本賬。對開發者的實際建議只剩一條:選型時盯住單任務成本,而不是單價。價格戰的第二階段,比的是誰的賬單更會“藏”。