谷歌 DeepMind 於 9 月 30 日釋出新一代前沿模型 Gemini 4 Argon,並宣佈該模型正通過其 Fairwind 計劃,向一批受信任的網路安全防禦方逐步開放。谷歌 DeepMind 高階副總裁兼谷歌首席 AI 架構師 Koray Kavukcuoglu 在公告中表示,Argon 面向複雜、長週期的專業工作流設計,能在真實軟體工程、法律與金融等企業知識工作,以及網路安全防禦等場景中提供前沿效能。
與以往模型相比,Argon 最直觀的變化在輸出能力上。谷歌將模型的輸出 token 上限從此前的 64K 大幅提升至業界領先的 100 萬 token。谷歌認為,當模型有足夠空間在單次軌跡中生成數十萬 token 時,它能在一次任務中完成更深層的推理,從而應對更棘手的問題。這一改動直接服務於長程、多步驟任務,也是 Argon 定位企業級工作流的基礎。
在谷歌內部,Argon 已投入實際使用。公告稱,數千名谷歌員工已在專業編碼、深度研究和寫作質量等任務中使用該模型。具體案例包括:在量子演算法最佳化中,Argon 幫助量子計算研究人員最佳化子程式的時空資源(量子位元×門),其中一個案例在數分鐘內將已發表的基線提升了 40%;在記憶體效率方面,一組 Argon 智慧體分析了全機群效能遙測資料,自主識別並應用記憶體最佳化,已釋放超過 300 TiB 記憶體,預計總節省量在 500 TiB 至 1 PiB 之間。
程式碼遷移是另一個重點方向。Argon 智慧體正在谷歌內部推進 C/C++ 程式碼庫向 Rust 的遷移,規模從 re2、libgav1 等核心庫的數萬行,擴充套件到 Fuchsia OS Zircon 核心的 80 萬行以上。谷歌強調,由於許多系統至關重要,這類大規模重寫在上線前要經過嚴格的自動化與人工審計、模擬測試和評審。以開源影片解碼軟體 libgav1 為例,Argon 智慧體接手已有的 Rust 移植版本,通過多輪效能引導實驗、研究編譯器輸出並生成安全 Rust 程式碼,替換了 3.2 萬行 SIMD 程式碼,最終得到一個記憶體安全的影片解碼器,執行速度比原 Rust 移植版快 2.7 倍,影片輸出完全一致,效能接近最佳化後的 C++ 版本。
在基準測試上,谷歌稱 Argon 在衡量真實長週期軟體工程任務的 DeepSWE v1.1 上取得 77.9% 的新最優成績;在按對美國 GDP 貢獻加權的 Vals Index 上,Argon 在金融、編碼、法律和稅務工作中領先;在 Vals Finance Agent v2(多步驟金融研究)和 Harvey 法律智慧體基準(法律研究與起草)等垂直評測中同樣表現領先。在 Zapier 衡量核心業務職能端到端執行的 AutomationBench 上,Argon 以 51.3% 的得分排名第一。此外,在長影片理解基準 LVBench 上,Argon 以 91.7% 的成績達到最優,能夠進行專業圖表分析、從長影片中識別細節,並基於一系列文件採取行動。
網路安全防禦是 Argon 首批落地的場景之一。谷歌表示,為幫助防禦方應對新時期的網路攻擊,模型在防禦性網路安全方向進行了專門訓練,這也是它率先通過 Fairwind 計劃向受信任防禦方開放的原因。谷歌同時強調,安全釋出這一級別的前沿能力需要分階段推進:公司正積極參與美國政府的自願性前置模型訪問流程,在逐步擴大訪問範圍的同時,持續從早期測試者收集反饋、迭代護欄機制,之後再儘快向開發者、企業和消費者開放。
定價方面,Argon 將以介紹性價格推出:每百萬輸入 token 2 美元,每百萬輸出 token 10 美元,快取輸入 token 價格為輸入 token 價格的 95% 折扣。
從產業視角看,Argon 的釋出延續了前沿模型競爭從“引數與跑分”轉向“可交付的企業工作流”的趨勢。百萬級輸出上限、面向法律金融等知識工作的評測佈局,以及先安全防禦、後大眾市場的分階段節奏,都指向同一個方向:模型廠商正試圖把長程推理能力嵌入企業核心流程,同時以合規與安全審查作為大規模商用的前置條件。對關注 AI 產業的讀者而言,值得跟蹤的是這類能力在真實企業環境中的採用速度、定價策略的後續調整,以及分階段釋出模式對開發者與消費者可用時間表的影響。