谷歌 DeepMind 于 2026 年 9 月 2 日发布两款新模型——Gemini 3.8 FlashGemini 3.8 Flash Cyber。这是继三周前推出 3.7 Flash 后,六周内第三次发布 Flash 系列模型。官方称 3.8 Flash 是“迄今最强的推理编码模型”,在保持与 3.7 Flash 相同速度和低成本的同时,性能显著提升;Cyber 版则定位为“最强网络安全模型”,在漏洞检测与自动修复方面达到前沿水平。

Gemini 3.8 Flash 的定价与 3.7 Flash 保持一致,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。官方表示,该模型在软件工程、智能体任务以及专业领域的关键多步推理上均有大幅改进。在长时软件工程基准 DeepSWE v1.1 上,3.8 Flash 以远低于大型前沿模型的成本,在端到端解决复杂工程问题方面超越了多数更大规模的模型。此外,在金融与法律等专业领域,它在 Vals Finance Agent V2Harvey 法律智能体基准 上的表现也优于 3.7 Flash 及其他前沿模型。在 HLE-Verified 基准上,3.8 Flash 取得了 54.9% 的成绩,展示了其在 STEM、人文学科和专业领域进行多步推理的能力。

性能提升源于模型“更努力地工作”——在复杂任务上会执行额外的推理步骤并迭代调用工具,有时会消耗更多 token 以最大化性能。对于以计算效率为首要约束的开发者,可通过降低“努力水平”来减少 token 开销,或继续使用完全受支持的 Gemini 3.7 Flash

Gemini 3.8 Flash Cyber 则通过 Fairwind 计划 向可信防御者提供,旨在为网络安全领域提供“决定性优势”。在行业标准漏洞发现基准 CyberGym 上,该模型展现了前沿水平的自主漏洞发现能力,超越了 3.5 Flash Cyber 以及显著更大的前沿模型。为更贴近真实防御需求,谷歌还使用了覆盖 20 种编程语言 的内部基准进行测试,结果显示模型在复杂代码库中的漏洞发现成功率超过 70%

在自动修复方面,Gemini 3.8 Flash Cyber 在外部基准 CWE-Bench(由 Collinear 运营)上处于帕累托前沿:其 pass@1 达到 47.2%,而领先的前沿模型为 47.8%,但成本显著更低。谷歌强调,该模型从设计之初就优先投资于漏洞修复,而非利用漏洞等攻击性能力。

谷歌已在内部使用 3.8 Flash Cyber 保护其代码。例如,Chrome 安全团队 发现,该模型对 Chrome 漏洞生成的正确补丁数量是“大得多的最佳商业模型”的 2.6 倍。此外,Wiz 也参与了相关评估。这些实际应用案例表明,模型在真实世界防御场景中具有直接价值。

两款模型共享同一基础智能,并通过长期运行的智能体循环(递归评估和优化底层模型)进一步加速。谷歌 DeepMind 产品管理高级总监 Tulsee Doshi 和网络安全负责人 Raluca Ada Popa 在公告中表示,这些性能提升源于多项创新,包括在高度严苛的网络安全领域进行严格训练。

从产业视角看,Gemini 3.8 Flash 系列延续了谷歌在低成本高性能模型上的竞争策略,直接对标其他前沿模型,同时为智能体工作流和网络安全等垂直场景提供专门优化。对于 AI 投资者而言,这一发布可能加剧模型层竞争,并推动下游应用对更高效、更安全 AI 的需求。不过,具体市场影响仍需观察实际采用情况。