谷歌 DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,采用 Apache 2.0 许可,模型卡已上线 Hugging Face。该模型总参数 7.4 亿,由 2.7 亿参数的文本骨干(其中 1.3 亿为 transformer、1.4 亿为 embedder)与可选择性加载的视觉编码器(1.7 亿)、音频编码器(3 亿)组合而成,目标是把文本(含代码)、图像、视频和音频——以及它们的组合——映射到同一个 768 维向量空间。

与只处理文本的嵌入模型不同,EmbeddingGemma 2 强调原生多模态:四种模态共享一个嵌入空间,开发者可按需只加载所需模态的编码器,从而控制内存与算力占用。模型设计面向手机、笔记本等消费级硬件,主打低延迟的端侧语义表示,适用场景包括搜索、检索增强生成(RAG)、分类和聚类。

在语言与代码能力上,模型支持 100 多种语言,代码任务较前代 EmbeddingGemma 1 提升约 14%。架构层面,模型共 24 层,模型维度 512、隐藏维度 2048,滑动窗口 1024 token,词表大小 262,144,采用分组查询注意力(GQA/MQA),局部与全局注意力比例 5:1,激活函数为 GELU 门控 FFN,池化方式为均值池化,并通过投影层把 512 维映射到 768 维。上下文窗口为 8,192 token,可处理数分钟的音频或视频。

模型原生支持 Matryoshka 表示学习(MRL),可将嵌入截断到 128、256、512 和 768 维并重新归一化。官方数据显示,截断到 256 维时质量损失很小,而存储成本可降至原来的三分之一;截断到 128 维时压缩比达 6 倍,更适合纯文本任务。这一特性对向量数据库的存储与检索成本有直接影响。

基准测试方面,EmbeddingGemma 2 在文本、代码、视觉、视觉文档、视频和音频嵌入任务上均有覆盖。在 768 维全精度下,多语言 MTEB v2 均值为 61.36(前代 61.15),代码 MTEB v1 为 78.68(前代 68.76);图像 MIEB lite 为 64.64,MMEB v2 图像 Hit@1 为 57.28,视觉文档 NDCG@5 为 67.84,视频 Hit@1 为 50.67;音频 MSEB 检索 MRR@10 为 69.54,MAEB 为 49.39。截断到 512 维时多数指标仅有小幅下降,256 维时仍保持较高水平。

使用方式上,模型可通过 sentence-transformers 与 transformers 库调用,示例代码展示了查询与文档分别编码后计算相似度。官方建议使用任务指令前缀:检索等非对称任务对查询和文档使用不同前缀,分类、相似度等对称任务对所有输入使用相同前缀;前缀仅适用于文本,图像、视频和音频不加前缀。带标题的文档建议格式化为 title: {title} | text: {content},无标题时使用 title: none。

从产业视角看,EmbeddingGemma 2 的发布延续了开源嵌入模型向多模态、端侧化演进的趋势。对 AI 应用开发者而言,一个可在消费级设备本地运行、支持四种模态且存储可压缩的嵌入模型,可能降低 RAG 与多模态检索系统的部署门槛;对向量数据库与边缘推理生态来说,MRL 截断带来的存储节省与端侧低延迟特性,则可能影响相关基础设施的选型逻辑。模型以 Apache 2.0 许可开放,也意味着商业使用限制较少,有望被更多下游产品集成。