谷歌在旗舰模型延期、竞争对手密集发布新模型的压力下,于近日一口气推出三款 Gemini Flash 系列模型,全部聚焦于降低 token 消耗和推理延迟,以“效率优先于绝对性能”的策略应对市场挑战。这三款模型分别是 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和面向安全场景的 Gemini 3.5 Flash Cyber。
其中,Gemini 3.6 Flash 是旗舰模型中的“主力款”,知识截止时间更新至 2026 年 3 月,在编程、知识型任务和多模态推理能力上有所提升,同时将平均输出 token 消耗降低了 17%。在部分使用场景中,其输出 token 相比前代最多可减少 65%。该模型输入价格为每百万 token 1.50 美元,输出价格从每百万 token 9 美元降至 7.5 美元。谷歌表示,通过减少中间推理步骤与工具调用,该模型显著压缩了多步骤 AI 工作流的整体运行成本。企业客户 Heavia 和 Harvey 反馈,在视觉处理、图表分析和数据提取等多模态任务中,模型表现得到增强。
Gemini 3.5 Flash-Lite 则定位为“最快、最具性价比”的模型,每秒可生成 350 个 token,面向高吞吐的智能体搜索和大规模文档处理场景。其输入价格为每百万 token 0.30 美元,输出价格为每百万 token 2.50 美元。谷歌称,Flash-Lite 在 SWE-Bench Pro 和 OSWorld-Verified 等基准测试中击败了旧款 3 Flash,终端工作台 2.1 评分从 31% 提升至 54%。
最具针对性的发布是 Gemini 3.5 Flash Cyber,该模型基于 3.5 Flash 打造,针对网络安全任务优化,用于发现和修复软件漏洞。谷歌将其集成进 CodeMender 代码安全智能体,由多个 Flash Cyber 子智能体并行运行。在 CyberGym 基准测试中,该模型取得 83.2% 的成绩,仅比 OpenAI 的 GPT-5.5-Cyber(85.6%)低约 2 个百分点,但模型规模小得多,成本优势明显。谷歌云漏洞研究团队利用该模型扫描公开 API,仅用两小时就发现了远程代码执行漏洞。在检测 Google Chrome 和 Safari 漏洞时,Flash Cyber 发现了 55 个已确认的独立问题,超过标准 3.5 Flash 的 47 个和 Anthropic 的 Claude Opus 4.6 的 36 个,其中 10 个漏洞是其他模型完全未能识别的。由于该模型在“进攻”和“防御”方面同样强大,谷歌严格控制访问权限,目前仅通过 CodeMender 在试点计划中向政府机构及可信合作伙伴开放。
然而,更引人注意的是“没有发布的东西”。谷歌原计划在 6 月推出的旗舰模型 Gemini 3.5 Pro 至今仍在测试阶段。据外媒 7 月 17 日报道,其延期是因为编程能力未能达到内部预期,而编程正是企业级 AI 最具商业价值的应用场景之一。6 月下旬团队尝试通过更新训练数据改进,但结果依然令人失望。受此消息影响,Alphabet Inc. 股价单日下跌约 4.4%,市值蒸发约 2000 亿美元。有 10 名现任和前任谷歌员工透露,许多人担心公司在竞争对手 Anthropic 和 OpenAI 推出更强模型后失去市场优势。
谷歌对此的回应是启动迄今为止“最雄心勃勃的一次预训练”,目标直指 Gemini 4。但这一表态更多是意图表达,而非已落地的能力。谷歌 CEO Sundar Pichai 曾表示,组合使用 Flash 系列模型每年可为企业节省超过 10 亿美元。这一“效率优先”策略在企业开始精打细算 token 成本的年份显得自洽,但能否成功取决于 Gemini 3.5 Pro 能否尽快落地,以及 Gemini 4 最终是否不只是一次“训练中的承诺”。