谷歌 DeepMind 于近日发布 Gemma 4 系列开源模型,涵盖五种尺寸(E2B、E4B、12B、26B A4B、31B),支持文本、图像、音频与视频输入,并输出文本。该系列模型采用 Apache 2.0 许可,面向从移动设备到服务器的多种部署场景,旨在降低先进 AI 的使用门槛。
Gemma 4 系列在架构上提供密集(Dense)与混合专家(MoE)两种变体,以适应不同规模的部署需求。其中,小尺寸模型(E2B、E4B)专为笔记本电脑和移动设备等端侧环境优化,而中等尺寸模型(12B、26B A4B、31B)则面向消费级 GPU 和工作站。所有模型均支持多模态输入,其中 E2B、E4B 和 12B 型号原生支持音频,而视频输入则覆盖全部型号。
在上下文窗口方面,小尺寸模型支持 128K token,中等尺寸模型支持 256K token,并维持对超过 140 种语言的多语言支持。模型采用混合注意力机制,将局部滑动窗口注意力与全局注意力结合,确保最后一层始终为全局注意力,从而在保持处理速度和低内存占用的同时,兼顾长上下文任务的深度理解。
Gemma 4 引入了多项关键能力与架构改进。所有模型均被设计为具备强推理能力,并支持可配置的思考模式。模型原生支持系统角色(system role),使对话更具结构性和可控性。此外,模型在编码基准上取得显著进步,并原生支持函数调用,增强了构建自主智能体的能力。
值得注意的是,本次发布还包含多 token 预测(MTP)草稿模型(如 google/gemma-4-12B-it-assistant)。MTP 通过扩展基础模型,加入一个更小、更快的草稿模型实现。在投机解码(Speculative Decoding)流程中,草稿模型可预测多个后续 token,由目标模型并行验证,从而将解码速度提升至 3 倍,同时保证与标准生成完全相同的质量。这使得这些检查点非常适合低延迟和端侧应用场景。
在参数设计上,小尺寸模型采用了每层嵌入(PLE)技术,为每个解码器层提供独立的嵌入表,以最大化端侧部署的参数效率。而 12B 型号则采用无编码器架构,直接通过轻量线性层将原始图像块和音频波形投影到 LLM 的嵌入空间,消除了专用编码器,降低了多模态处理的延迟,并允许整个模型在一次训练中完成微调。MoE 型号(26B A4B)在推理时仅激活 4B 参数,运行速度接近 4B 参数模型,但总参数达 25.2B,在快速推理场景下优于密集的 31B 模型。
Gemma 4 系列的发布延续了谷歌 DeepMind 在开源模型领域的布局,其多样化的尺寸和架构选择,为开发者在不同硬件条件下部署 AI 提供了更多灵活性,有望推动端侧 AI 和智能体应用的进一步发展。