谷歌 DeepMind 於 2026 年 9 月 2 日釋出兩款新模型——Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber。這是繼三週前推出 3.7 Flash 後,六週內第三次釋出 Flash 系列模型。官方稱 3.8 Flash 是“迄今最強的推理編碼模型”,在保持與 3.7 Flash 相同速度和低成本的同時,效能顯著提升;Cyber 版則定位為“最強網路安全模型”,在漏洞檢測與自動修復方面達到前沿水平。
Gemini 3.8 Flash 的定價與 3.7 Flash 保持一致,為每百萬輸入 token 0.75 美元、每百萬輸出 token 3.75 美元。官方表示,該模型在軟體工程、智慧體任務以及專業領域的關鍵多步推理上均有大幅改進。在長時軟體工程基準 DeepSWE v1.1 上,3.8 Flash 以遠低於大型前沿模型的成本,在端到端解決複雜工程問題方面超越了多數更大規模的模型。此外,在金融與法律等專業領域,它在 Vals Finance Agent V2 和 Harvey 法律智慧體基準 上的表現也優於 3.7 Flash 及其他前沿模型。在 HLE-Verified 基準上,3.8 Flash 取得了 54.9% 的成績,展示了其在 STEM、人文學科和專業領域進行多步推理的能力。
效能提升源於模型“更努力地工作”——在複雜任務上會執行額外的推理步驟並迭代呼叫工具,有時會消耗更多 token 以最大化效能。對於以計算效率為首要約束的開發者,可通過降低“努力水平”來減少 token 開銷,或繼續使用完全受支援的 Gemini 3.7 Flash。
Gemini 3.8 Flash Cyber 則通過 Fairwind 計劃 向可信防禦者提供,旨在為網路安全領域提供“決定性優勢”。在行業標準漏洞發現基準 CyberGym 上,該模型展現了前沿水平的自主漏洞發現能力,超越了 3.5 Flash Cyber 以及顯著更大的前沿模型。為更貼近真實防禦需求,谷歌還使用了覆蓋 20 種程式語言 的內部基準進行測試,結果顯示模型在複雜程式碼庫中的漏洞發現成功率超過 70%。
在自動修復方面,Gemini 3.8 Flash Cyber 在外部基準 CWE-Bench(由 Collinear 運營)上處於帕累託前沿:其 pass@1 達到 47.2%,而領先的前沿模型為 47.8%,但成本顯著更低。谷歌強調,該模型從設計之初就優先投資於漏洞修復,而非利用漏洞等攻擊效能力。
谷歌已在內部使用 3.8 Flash Cyber 保護其程式碼。例如,Chrome 安全團隊 發現,該模型對 Chrome 漏洞生成的正確補丁數量是“大得多的最佳商業模型”的 2.6 倍。此外,Wiz 也參與了相關評估。這些實際應用案例表明,模型在真實世界防禦場景中具有直接價值。
兩款模型共享同一基礎智慧,並通過長期執行的智慧體迴圈(遞迴評估和最佳化底層模型)進一步加速。谷歌 DeepMind 產品管理高階總監 Tulsee Doshi 和網路安全負責人 Raluca Ada Popa 在公告中表示,這些效能提升源於多項創新,包括在高度嚴苛的網路安全領域進行嚴格訓練。
從產業視角看,Gemini 3.8 Flash 系列延續了谷歌在低成本高效能模型上的競爭策略,直接對標其他前沿模型,同時為智慧體工作流和網路安全等垂直場景提供專門最佳化。對於 AI 投資者而言,這一發布可能加劇模型層競爭,並推動下游應用對更高效、更安全 AI 的需求。不過,具體市場影響仍需觀察實際採用情況。