谷歌 DeepMind 于 4 月 11 日在 Hugging Face 平台发布了 Gemma 4 系列模型的 QAT(量化感知训练) 优化版本,旨在通过量化技术大幅降低模型内存占用,同时保持接近 bfloat16 精度的推理质量。该系列包含 E2B、E4B、12B、26B A4B 和 31B 五种尺寸,覆盖从移动设备到服务器的部署场景。
Gemma 4 是谷歌 DeepMind 推出的开源模型家族,支持多模态输入(文本、图像,以及 E2B、E4B 和 12B 型号的音频)并生成文本输出。此次发布的 QAT 版本提供了四种部署格式:未量化的 QAT 检查点(Q4_0,适合定制编译与研究)、GGUF 格式(Q4_0,兼容广泛生态)、移动优化格式(wNa8o8,专为移动硬件设计,采用 2-bit 解码层和优化 KV 缓存)以及压缩张量格式(w4a16,支持 vLLM 原生推理)。这些格式覆盖了从研究到生产、从服务器到手机的全链路需求。
在架构上,Gemma 4 采用了混合注意力机制,交织局部滑动窗口注意力与全局注意力,并确保最后一层始终为全局注意力,以平衡处理速度与长上下文理解能力。小模型支持 128K 令牌 上下文窗口,中型模型支持 256K 令牌,并原生支持系统提示词(system role),使对话更可控。模型还引入了可配置的思考模式,增强了推理能力,并在编码基准测试中取得显著提升,同时支持原生函数调用,赋能自主代理。
值得注意的是,E2B 和 E4B 型号中的“E”代表“有效参数”,它们通过逐层嵌入(PLE)技术最大化参数效率,有效参数分别为 2.3B 和 4.5B,但总参数(含嵌入层)分别为 5.1B 和 8B。12B 型号采用无编码器架构,将原始图像块和音频波形直接投影到 LLM 嵌入空间,减少多模态延迟并支持单次微调。26B A4B 则为混合专家(MoE)模型,拥有 25.2B 总参数和 3.8B 活跃参数,采用 8 个活跃专家与 128 个总专家加 1 个共享专家的配置。
此次 QAT 优化版的发布,使 Gemma 4 系列在保持前沿性能的同时,显著降低了部署门槛,尤其针对移动和边缘设备。这有助于推动开源大模型在消费级硬件上的普及,并可能影响 AI 芯片适配、模型压缩技术以及云边协同的产业格局。