據《華爾街日報》獨家爆料,谷歌將於明日(當地時間)釋出新一代輕量級模型Gemini 3.8 Flash(代號Skimaki),同時放棄此前預告的Gemini 3.5 Pro。這一訊息在AI圈引發熱議,因為就在幾天前,Anthropic剛推出Claude 5.1,而OpenAI的Astra也即將亮相,谷歌此舉被視為對競爭壓力的直接回應。
Gemini 3.5 Pro被取消是本次爆料的重磅資訊。該模型曾在今年5月的I/O大會上預告,但近4個月過去,其進展甚至不如Flash版本,谷歌被迫“棄子”。據內部人士透露,谷歌已投入更多人力和算力提升Gemini的程式設計能力,尤其是加大強化學習投入,讓AI通過試錯學習。同時,谷歌DeepMind並行推進多個專案,以分散風險。
儘管3.5 Pro夭折,但Gemini 4.0在預訓練中評估優秀,後訓練仍在進行中。爆料還稱,Gemini 3.8 Flash在谷歌內部編碼工具Jetski的對比測試中“碾壓”Opus模型,程式設計實力強勁。該模型已研發數月,早於谷歌領導層變動——Demis Hassabis讓位、首席科學家Jeff Dean離職——之前就已啟動,目前內部進展順利。
谷歌選擇先推Flash版本,是因為其引數小、所需計算少,更容易出成果。這一策略與OpenAI和Anthropic形成對比:OpenAI的下一代Astra採用“迴圈深度”新型推理方法,減少思考token並提升效能,預計本週揭曉;Anthropic的Claude 5.1則主攻程式設計和科研領域。此外,馬斯克預告Grok 4.7將在十天後釋出,四家科技巨頭幾乎同時發力,AI模型競爭進入白熱化階段。
在釋出Gemini 3.8 Flash之前,谷歌今日已為Gemini系列引入智慧體影片理解(Agentic Video Understanding)功能。該功能允許模型自主決定觀看影片的片段、速度和模態(畫面、音訊或轉錄文字),而非被動接收固定幀率。官方部落格顯示,在標準影片分析基準上,開啟該功能後token消耗最多降低88%,分析成本最多降66%,準確率最高提升7%,且不額外收費,仍按標準API token定價。
這一功能解決了影片處理的高成本痛點——影片是模態中最貴的,一分鐘影片可能消耗相當於一本書的token。通過“拖進度條”式的高效取樣,模型能處理亞秒級片段檢索、長影片問答、異常檢測和計數等任務,使自動剪輯、安防監控、產線質檢等場景真正可行。谷歌此前已在影像理解上應用類似思路,此次將工具擴充套件至原生影片。
谷歌此舉意在讓Agent“看得起”影片,突破以往依賴文字轉述的侷限。隨著成本曲線下移,Agent能直接處理監控、課程、素材等影片內容,而無需等待人工轉寫。這被視為谷歌在AI Agent競爭中的關鍵佈局,尤其在OpenAI和Anthropic已在前沿模型和程式設計Agent上佔據優勢的背景下。
目前,谷歌計劃先推出Gemini 3.8 Flash,以快速回應市場。但分析師指出,谷歌能否在Gemini 4.0上兌現潛力,才是決定其能否與OpenAI、Anthropic抗衡的關鍵。隨著四家公司釋出節奏撞車,AI大戰的下一個回合已悄然開啟。