谷歌 DeepMind 于 9 月 30 日发布新一代前沿模型 Gemini 4 Argon,并宣布该模型正通过其 Fairwind 计划,向一批受信任的网络安全防御方逐步开放。谷歌 DeepMind 高级副总裁兼谷歌首席 AI 架构师 Koray Kavukcuoglu 在公告中表示,Argon 面向复杂、长周期的专业工作流设计,能在真实软件工程、法律与金融等企业知识工作,以及网络安全防御等场景中提供前沿性能。
与以往模型相比,Argon 最直观的变化在输出能力上。谷歌将模型的输出 token 上限从此前的 64K 大幅提升至业界领先的 100 万 token。谷歌认为,当模型有足够空间在单次轨迹中生成数十万 token 时,它能在一次任务中完成更深层的推理,从而应对更棘手的问题。这一改动直接服务于长程、多步骤任务,也是 Argon 定位企业级工作流的基础。
在谷歌内部,Argon 已投入实际使用。公告称,数千名谷歌员工已在专业编码、深度研究和写作质量等任务中使用该模型。具体案例包括:在量子算法优化中,Argon 帮助量子计算研究人员优化子程序的时空资源(量子比特×门),其中一个案例在数分钟内将已发表的基线提升了 40%;在内存效率方面,一组 Argon 智能体分析了全机群性能遥测数据,自主识别并应用内存优化,已释放超过 300 TiB 内存,预计总节省量在 500 TiB 至 1 PiB 之间。
代码迁移是另一个重点方向。Argon 智能体正在谷歌内部推进 C/C++ 代码库向 Rust 的迁移,规模从 re2、libgav1 等核心库的数万行,扩展到 Fuchsia OS Zircon 内核的 80 万行以上。谷歌强调,由于许多系统至关重要,这类大规模重写在上线前要经过严格的自动化与人工审计、仿真测试和评审。以开源视频解码软件 libgav1 为例,Argon 智能体接手已有的 Rust 移植版本,通过多轮性能引导实验、研究编译器输出并生成安全 Rust 代码,替换了 3.2 万行 SIMD 代码,最终得到一个内存安全的视频解码器,运行速度比原 Rust 移植版快 2.7 倍,视频输出完全一致,性能接近优化后的 C++ 版本。
在基准测试上,谷歌称 Argon 在衡量真实长周期软件工程任务的 DeepSWE v1.1 上取得 77.9% 的新最优成绩;在按对美国 GDP 贡献加权的 Vals Index 上,Argon 在金融、编码、法律和税务工作中领先;在 Vals Finance Agent v2(多步骤金融研究)和 Harvey 法律智能体基准(法律研究与起草)等垂直评测中同样表现领先。在 Zapier 衡量核心业务职能端到端执行的 AutomationBench 上,Argon 以 51.3% 的得分排名第一。此外,在长视频理解基准 LVBench 上,Argon 以 91.7% 的成绩达到最优,能够进行专业图表分析、从长视频中识别细节,并基于一系列文档采取行动。
网络安全防御是 Argon 首批落地的场景之一。谷歌表示,为帮助防御方应对新时期的网络攻击,模型在防御性网络安全方向进行了专门训练,这也是它率先通过 Fairwind 计划向受信任防御方开放的原因。谷歌同时强调,安全发布这一级别的前沿能力需要分阶段推进:公司正积极参与美国政府的自愿性前置模型访问流程,在逐步扩大访问范围的同时,持续从早期测试者收集反馈、迭代护栏机制,之后再尽快向开发者、企业和消费者开放。
定价方面,Argon 将以介绍性价格推出:每百万输入 token 2 美元,每百万输出 token 10 美元,缓存输入 token 价格为输入 token 价格的 95% 折扣。
从产业视角看,Argon 的发布延续了前沿模型竞争从“参数与跑分”转向“可交付的企业工作流”的趋势。百万级输出上限、面向法律金融等知识工作的评测布局,以及先安全防御、后大众市场的分阶段节奏,都指向同一个方向:模型厂商正试图把长程推理能力嵌入企业核心流程,同时以合规与安全审查作为大规模商用的前置条件。对关注 AI 产业的读者而言,值得跟踪的是这类能力在真实企业环境中的采用速度、定价策略的后续调整,以及分阶段发布模式对开发者与消费者可用时间表的影响。