谷歌 DeepMind 於近日釋出 Gemma 4 系列開源模型,涵蓋五種尺寸(E2BE4B12B26B A4B31B),支援文本、影像、音訊與影片輸入,並輸出文本。該系列模型採用 Apache 2.0 許可,面向從移動裝置到伺服器的多種部署場景,旨在降低先進 AI 的使用門檻。

Gemma 4 系列在架構上提供密集(Dense)混合專家(MoE)兩種變體,以適應不同規模的部署需求。其中,小尺寸模型(E2B、E4B)專為筆記型電腦和移動裝置等端側環境最佳化,而中等尺寸模型(12B、26B A4B、31B)則面向消費級 GPU 和工作站。所有模型均支援多模態輸入,其中 E2B、E4B 和 12B 型號原生支援音訊,而影片輸入則覆蓋全部型號。

上下文視窗方面,小尺寸模型支援 128K token,中等尺寸模型支援 256K token,並維持對超過 140 種語言的多語言支援。模型採用混合注意力機制,將區域性滑動視窗注意力與全域性注意力結合,確保最後一層始終為全域性注意力,從而在保持處理速度和低記憶體佔用的同時,兼顧長上下文任務的深度理解。

Gemma 4 引入了多項關鍵能力與架構改進。所有模型均被設計為具備強推理能力,並支援可配置的思考模式。模型原生支援系統角色(system role),使對話更具結構性和可控性。此外,模型在編碼基準上取得顯著進步,並原生支援函式呼叫,增強了構建自主智慧體的能力。

值得注意的是,本次釋出還包含多 token 預測(MTP)草稿模型(如 google/gemma-4-12B-it-assistant)。MTP 通過擴充套件基礎模型,加入一個更小、更快的草稿模型實現。在投機解碼(Speculative Decoding)流程中,草稿模型可預測多個後續 token,由目標模型並行驗證,從而將解碼速度提升至 3 倍,同時保證與標準生成完全相同的質量。這使得這些檢查點非常適合低延遲和端側應用場景。

在引數設計上,小尺寸模型採用了每層嵌入(PLE)技術,為每個解碼器層提供獨立的嵌入表,以最大化端側部署的引數效率。而 12B 型號則採用無編碼器架構,直接通過輕量線性層將原始影像塊和音訊波形投影到 LLM 的嵌入空間,消除了專用編碼器,降低了多模態處理的延遲,並允許整個模型在一次訓練中完成微調。MoE 型號(26B A4B)在推理時僅啟用 4B 引數,執行速度接近 4B 引數模型,但總引數達 25.2B,在快速推理場景下優於密集的 31B 模型。

Gemma 4 系列的釋出延續了谷歌 DeepMind 在開源模型領域的佈局,其多樣化的尺寸和架構選擇,為開發者在不同硬體條件下部署 AI 提供了更多靈活性,有望推動端側 AI 和智慧體應用的進一步發展。