Google DeepMind 近日在 Hugging Face 平台正式釋出了 Gemma 4 系列模型的量化感知訓練(QAT)最佳化版本,為開發者提供了從移動端到伺服器端的多樣化部署選擇。此次更新覆蓋了 Gemma 4 家族的全部五個尺寸——E2B、E4B、12B、26B A4B 和 31B,並同步推出了四種不同格式的模型權重,以滿足不同硬體環境下的推理需求。
根據官方模型卡說明,QAT 技術的核心優勢在於能夠在保持與 bfloat16 精度相近輸出質量的前提下,顯著壓縮模型的記憶體佔用。這意味著原本需要高階 GPU 才能執行的模型,現在可以在更廣泛的裝置上高效執行。此次釋出的四種格式分別為:未量化 QAT 檢查點(Q4_0),提供從 QAT 流程中提取的半精度權重,適合自定義下游編譯和研究用途;GGUF 格式,面向廣泛生態相容性的即用型部署方案;移動端最佳化格式(wNa8o8),採用針對手機硬體效率定製的架構,包含 2 位元解碼層、最佳化的 KV 快取和靜態啟用,以最大化節省視訊記憶體;以及壓縮張量格式(w4a16),通過 vLLM 實現原生最佳化推理。
Gemma 4 系列本身是 Google DeepMind 構建的多模態開放模型家族,支援文本和影像輸入,其中 E2B、E4B 和 12B 模型還原生支援音訊處理。模型提供預訓練和指令微調兩種變體,上下文視窗最高可達 256K 個 token,並保持對 140 多種語言的多語言支援。在架構上,該系列同時包含密集模型和混合專家(MoE)模型,適用於文本生成、程式設計和推理等任務。
從引數規模看,E2B 的有效引數量為 23 億,E4B 為 45 億,兩者均採用逐層嵌入技術以提升端側部署的引數效率。12B 模型則採用無編碼器的統一架構,將影像和音訊原始資料直接投影到語言模型的嵌入空間,減少了多模態延遲。26B A4B 作為 MoE 模型,總引數量達 252 億,但每次推理僅啟用 38 億引數,兼顧了效能與計算成本。31B 則是密集模型中的最大規格,面向需要更強算力的場景。
此次量化版本的推出,進一步強化了 Gemma 4 在端側 AI 和邊緣計算領域的適用性。較小的 E2B 和 E4B 模型專門針對筆記型電腦和移動裝置的本地高效執行進行了最佳化,而 12B 及以上模型則瞄準消費級 GPU 和工作站。這種從手機到伺服器的全覆蓋策略,反映出 Google DeepMind 意圖通過開放權重和靈活的部署選項,降低前沿 AI 模型的使用門檻,加速多模態應用在各類硬體上的滲透。
對於開發者而言,QAT 最佳化帶來的直接好處是更低的推理成本和更快的響應速度,尤其是在資源受限的環境中。移動端最佳化格式的推出,可能推動更多具備即時音訊、影像理解能力的 AI 應用出現在智慧手機上。而壓縮張量格式與 vLLM 的整合,則為資料中心規模的高效推理提供了現成方案。這些進展共同指向一個趨勢:模型效率的提升正在讓先進 AI 能力從雲端向邊緣擴散,為下游應用創新開啟更大空間。