谷歌 DeepMind 釋出開源多模態嵌入模型 EmbeddingGemma 2,採用 Apache 2.0 許可,模型卡已上線 Hugging Face。該模型總引數 7.4 億,由 2.7 億引數的文本骨幹(其中 1.3 億為 transformer、1.4 億為 embedder)與可選擇性載入的視覺編碼器(1.7 億)、音訊編碼器(3 億)組合而成,目標是把文本(含程式碼)、影像、影片和音訊——以及它們的組合——對映到同一個 768 維向量空間。
與只處理文本的嵌入模型不同,EmbeddingGemma 2 強調原生多模態:四種模態共享一個嵌入空間,開發者可按需只加載所需模態的編碼器,從而控制記憶體與算力佔用。模型設計面向手機、筆記本等消費級硬體,主打低延遲的端側語義表示,適用場景包括搜尋、檢索增強生成(RAG)、分類和聚類。
在語言與程式碼能力上,模型支援 100 多種語言,程式碼任務較前代 EmbeddingGemma 1 提升約 14%。架構層面,模型共 24 層,模型維度 512、隱藏維度 2048,滑動視窗 1024 token,詞表大小 262,144,採用分組查詢注意力(GQA/MQA),區域性與全域性注意力比例 5:1,啟用函式為 GELU 門控 FFN,池化方式為均值池化,並通過投影層把 512 維對映到 768 維。上下文視窗為 8,192 token,可處理數分鐘的音訊或影片。
模型原生支援 Matryoshka 表示學習(MRL),可將嵌入截斷到 128、256、512 和 768 維並重新歸一化。官方資料顯示,截斷到 256 維時質量損失很小,而儲存成本可降至原來的三分之一;截斷到 128 維時壓縮比達 6 倍,更適合純文本任務。這一特性對向量資料庫的儲存與檢索成本有直接影響。
基準測試方面,EmbeddingGemma 2 在文本、程式碼、視覺、視覺文件、影片和音訊嵌入任務上均有覆蓋。在 768 維全精度下,多語言 MTEB v2 均值為 61.36(前代 61.15),程式碼 MTEB v1 為 78.68(前代 68.76);影像 MIEB lite 為 64.64,MMEB v2 影像 Hit@1 為 57.28,視覺文件 NDCG@5 為 67.84,影片 Hit@1 為 50.67;音訊 MSEB 檢索 MRR@10 為 69.54,MAEB 為 49.39。截斷到 512 維時多數指標僅有小幅下降,256 維時仍保持較高水平。
使用方式上,模型可通過 sentence-transformers 與 transformers 庫呼叫,示例程式碼展示了查詢與文件分別編碼後計算相似度。官方建議使用任務指令字首:檢索等非對稱任務對查詢和文件使用不同字首,分類、相似度等對稱任務對所有輸入使用相同字首;字首僅適用於文本,影像、影片和音訊不加字首。帶標題的文件建議格式化為 title: {title} | text: {content},無標題時使用 title: none。
從產業視角看,EmbeddingGemma 2 的釋出延續了開源嵌入模型向多模態、端側化演進的趨勢。對 AI 應用開發者而言,一個可在消費級裝置本地執行、支援四種模態且儲存可壓縮的嵌入模型,可能降低 RAG 與多模態檢索系統的部署門檻;對向量資料庫與邊緣推理生態來說,MRL 截斷帶來的儲存節省與端側低延遲特性,則可能影響相關基礎設施的選型邏輯。模型以 Apache 2.0 許可開放,也意味著商業使用限制較少,有望被更多下游產品整合。