谷歌 DeepMind 於 4 月 11 日在 Hugging Face 平台釋出了 Gemma 4 系列模型的 QAT(量化感知訓練) 最佳化版本,旨在通過量化技術大幅降低模型記憶體佔用,同時保持接近 bfloat16 精度的推理質量。該系列包含 E2B、E4B、12B、26B A4B 和 31B 五種尺寸,覆蓋從移動裝置到伺服器的部署場景。
Gemma 4 是谷歌 DeepMind 推出的開源模型家族,支援多模態輸入(文本、影像,以及 E2B、E4B 和 12B 型號的音訊)並生成文本輸出。此次釋出的 QAT 版本提供了四種部署格式:未量化的 QAT 檢查點(Q4_0,適合定製編譯與研究)、GGUF 格式(Q4_0,相容廣泛生態)、移動最佳化格式(wNa8o8,專為移動硬體設計,採用 2-bit 解碼層和最佳化 KV 快取)以及壓縮張量格式(w4a16,支援 vLLM 原生推理)。這些格式覆蓋了從研究到生產、從伺服器到手機的全鏈路需求。
在架構上,Gemma 4 採用了混合注意力機制,交織區域性滑動視窗注意力與全域性注意力,並確保最後一層始終為全域性注意力,以平衡處理速度與長上下文理解能力。小模型支援 128K 令牌 上下文視窗,中型模型支援 256K 令牌,並原生支援系統提示詞(system role),使對話更可控。模型還引入了可配置的思考模式,增強了推理能力,並在編碼基準測試中取得顯著提升,同時支援原生函式呼叫,賦能自主代理。
值得注意的是,E2B 和 E4B 型號中的“E”代表“有效引數”,它們通過逐層嵌入(PLE)技術最大化引數效率,有效引數分別為 2.3B 和 4.5B,但總引數(含嵌入層)分別為 5.1B 和 8B。12B 型號採用無編碼器架構,將原始影像塊和音訊波形直接投影到 LLM 嵌入空間,減少多模態延遲並支援單次微調。26B A4B 則為混合專家(MoE)模型,擁有 25.2B 總引數和 3.8B 活躍引數,採用 8 個活躍專家與 128 個總專家加 1 個共享專家的配置。
此次 QAT 最佳化版的釋出,使 Gemma 4 系列在保持前沿效能的同時,顯著降低了部署門檻,尤其針對移動和邊緣裝置。這有助於推動開源大模型在消費級硬體上的普及,並可能影響 AI 晶片適配、模型壓縮技術以及雲邊協同的產業格局。