騰訊於 2026 年 2 月通過 Hugging Face 釋出並開源了 9B 引數的多模態嵌入模型 WeMM-Embedding-9B。該模型基於 Qwen3.5 構建,能夠同時處理文本、影像、影片、視覺文件以及交錯的多模態輸入,並輸出 4096 維的 L2 歸一化嵌入向量,但不支援音訊輸入。這一發布標誌著騰訊在 AI 基礎設施層(尤其是多模態檢索與理解)的又一重要佈局。

在技術指標上,WeMM-Embedding-9B 在兩大主流基準上均取得了領先成績。在 MMEB-v2 基準(涵蓋 78 個數據集)上,其平均分達到 80.6,其中影像任務 Hit@1 為 81.9,影片任務為 74.3,視覺文件任務 NDCG@5 為 83.3,全面超越了同規模的 DME-Medium(78.4)以及更大規模的 VLM2Vec 8B(53.2)等模型。在更全面的 MMEB-v3 基準(覆蓋 190 個任務,包含文本、智慧體、跨模態檢索等)上,其平均分達到 59.5,同樣位居榜首,顯著領先於 Qwen3-VL-Embedding 8B(53.5)等競品。值得注意的是,MMEB-v3 中音訊任務得分為 0,因為該模型不支援音訊輸入,但整體表現仍優於多數支援音訊的模型。

WeMM-Embedding-9B 的設計強調通用性與實用性。它支援 Matryoshka 嵌入(MRL),允許使用者通過擷取嵌入向量的前若干維度(如 256 維)來降低儲存與計算成本,同時保持較好的檢索效能。模型相容多種主流推理框架,包括 TransformersSentence TransformersvLLM(0.27.0 及以上)以及 SGLang(0.5.9 及以上),並提供了詳細的程式碼示例,便於開發者快速整合。此外,模型支援將文本、影像、影片等不同模態的內容混合編碼,例如使用者可以用文本查詢去匹配包含影像或影片的文件,這為多模態檢索增強生成(RAG)等應用提供了便利。

從產業視角看,多模態嵌入模型是連線視覺、語言與影片內容的關鍵技術,直接影響搜尋、推薦、智慧體記憶等上層應用的效能。騰訊此次開源 9B 級模型並登頂基準,不僅展示了其在多模態理解領域的技術積累,也可能對現有嵌入模型生態(如基於 CLIP 或純文本嵌入的方案)形成競爭壓力。對於 AI 應用開發者而言,一個開源、高效能且支援影片與文件的嵌入模型,有望降低多模態應用的開發門檻,並推動檢索與生成技術的融合。

值得注意的是,該模型基於 Qwen3.5 底座,體現了騰訊與阿里在開源模型生態上的合作趨勢。同時,騰訊在模型卡片中引用了技術報告,並鼓勵社群引用,顯示出其希望通過開源建立技術影響力的意圖。不過,目前該模型尚未提供音訊支援,這在一定程度上限制了其在全模態場景下的應用,未來是否會擴充套件音訊能力值得關注。總體而言,WeMM-Embedding-9B 的釋出是多模態 AI 基礎設施領域的一個重要進展,其基準成績與開源策略可能對行業產生持續影響。