谷歌在旗艦模型延期、競爭對手密集釋出新模型的壓力下,於近日一口氣推出三款 Gemini Flash 系列模型,全部聚焦於降低 token 消耗和推理延遲,以“效率優先於絕對效能”的策略應對市場挑戰。這三款模型分別是 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和麵向安全場景的 Gemini 3.5 Flash Cyber。
其中,Gemini 3.6 Flash 是旗艦模型中的“主力款”,知識截止時間更新至 2026 年 3 月,在程式設計、知識型任務和多模態推理能力上有所提升,同時將平均輸出 token 消耗降低了 17%。在部分使用場景中,其輸出 token 相比前代最多可減少 65%。該模型輸入價格為每百萬 token 1.50 美元,輸出價格從每百萬 token 9 美元降至 7.5 美元。谷歌表示,通過減少中間推理步驟與工具呼叫,該模型顯著壓縮了多步驟 AI 工作流的整體執行成本。企業客戶 Heavia 和 Harvey 反饋,在視覺處理、圖表分析和資料提取等多模態任務中,模型表現得到增強。
Gemini 3.5 Flash-Lite 則定位為“最快、最具價效比”的模型,每秒可生成 350 個 token,面向高吞吐的智慧體搜尋和大規模文件處理場景。其輸入價格為每百萬 token 0.30 美元,輸出價格為每百萬 token 2.50 美元。谷歌稱,Flash-Lite 在 SWE-Bench Pro 和 OSWorld-Verified 等基準測試中擊敗了舊款 3 Flash,終端工作台 2.1 評分從 31% 提升至 54%。
最具針對性的釋出是 Gemini 3.5 Flash Cyber,該模型基於 3.5 Flash 打造,針對網路安全任務最佳化,用於發現和修復軟體漏洞。谷歌將其整合進 CodeMender 程式碼安全智慧體,由多個 Flash Cyber 子智慧體並行執行。在 CyberGym 基準測試中,該模型取得 83.2% 的成績,僅比 OpenAI 的 GPT-5.5-Cyber(85.6%)低約 2 個百分點,但模型規模小得多,成本優勢明顯。谷歌雲漏洞研究團隊利用該模型掃描公開 API,僅用兩小時就發現了遠端程式碼執行漏洞。在檢測 Google Chrome 和 Safari 漏洞時,Flash Cyber 發現了 55 個已確認的獨立問題,超過標準 3.5 Flash 的 47 個和 Anthropic 的 Claude Opus 4.6 的 36 個,其中 10 個漏洞是其他模型完全未能識別的。由於該模型在“進攻”和“防禦”方面同樣強大,谷歌嚴格控制訪問許可權,目前僅通過 CodeMender 在試點計劃中向政府機構及可信合作伙伴開放。
然而,更引人注意的是“沒有釋出的東西”。谷歌原計劃在 6 月推出的旗艦模型 Gemini 3.5 Pro 至今仍在測試階段。據外媒 7 月 17 日報道,其延期是因為程式設計能力未能達到內部預期,而程式設計正是企業級 AI 最具商業價值的應用場景之一。6 月下旬團隊嘗試通過更新訓練資料改進,但結果依然令人失望。受此訊息影響,Alphabet Inc. 股價單日下跌約 4.4%,市值蒸發約 2000 億美元。有 10 名現任和前任谷歌員工透露,許多人擔心公司在競爭對手 Anthropic 和 OpenAI 推出更強模型後失去市場優勢。
谷歌對此的回應是啟動迄今為止“最雄心勃勃的一次預訓練”,目標直指 Gemini 4。但這一表態更多是意圖表達,而非已落地的能力。谷歌 CEO Sundar Pichai 曾表示,組合使用 Flash 系列模型每年可為企業節省超過 10 億美元。這一“效率優先”策略在企業開始精打細算 token 成本的年份顯得自洽,但能否成功取決於 Gemini 3.5 Pro 能否儘快落地,以及 Gemini 4 最終是否不只是一次“訓練中的承諾”。