騰訊旗下混元團隊於Hugging Face平台釋出了WeMM-Embedding-9B,一個通用多模態嵌入模型。該模型基於Qwen3.5-9B構建,能夠處理文本、影像、影片、視覺文件以及交錯多模態輸入,並輸出4096維的L2歸一化嵌入向量。值得注意的是,模型不支援音訊輸入。在MMEB-v2基準的“任意到任意檢索”任務中,WeMM-Embedding-9B取得了80.6分的整體得分,該結果已列入MMEB-v2排行榜。模型採用Apache 2.0開源許可,程式碼、模型引數及權重均公開可用。

WeMM-Embedding-9B的釋出標誌著騰訊在多模態嵌入技術上的又一進展。嵌入模型是將非結構化資料(如文本、圖片、影片)轉換為向量表示的關鍵元件,廣泛應用於搜尋、推薦、聚類等場景。該模型支援將不同模態的內容對映到同一向量空間,使得跨模態檢索(如用文本搜圖片、用圖片搜影片)成為可能。其“任意到任意”的設計理念,旨在統一處理多種輸入型別,簡化應用開發流程。

從技術細節看,模型提供了靈活的整合方式。開發者可通過Transformers庫或Sentence Transformers庫呼叫,並支援Matryoshka嵌入(即截斷維度以降低儲存和計算成本),例如可指定256維嵌入。此外,模型還支援通過vLLMSGLang等推理框架進行服務化部署,便於生產環境使用。這些特性降低了多模態AI應用的門檻,尤其對需要處理海量多模態資料的企業具有吸引力。

在產業層面,多模態嵌入模型是AI基礎設施的重要組成部分。隨著影片、影像內容在網際網路中的佔比持續提升,高效的跨模態檢索能力成為搜尋、內容推薦、智慧客服等應用的核心需求。騰訊此次推出的模型,直接對標市場上已有的多模態嵌入方案,如OpenAI的CLIP、谷歌的Universal Sentence Encoder等,但WeMM-Embedding-9B在引數量(9B)和輸入模態多樣性上更具優勢。其基於Qwen3.5-9B的底座,也體現了騰訊與阿里在開源模型生態上的合作。

從競爭角度看,WeMM-Embedding-9B的釋出可能加劇嵌入模型市場的競爭。目前,該領域已有多個開源模型,如BGE-M3、E5-Mistral等,但多模態嵌入模型仍相對稀缺。騰訊的入局,有望推動多模態檢索技術的普及,並可能帶動相關工具鏈(如向量資料庫、檢索增強生成)的發展。對於AI應用開發者而言,這意味著更多選擇,但也需注意不同模型在特定任務上的效能差異。

值得注意的是,模型在MMEB-v2上的80.6分,反映了其在統一多模態檢索任務上的基準表現,但實際效果還需在具體業務場景中驗證。騰訊在模型卡中提供了詳細的安裝與使用說明,並附有技術報告引用,顯示其工程化準備較為充分。未來,隨著多模態資料的爆炸式增長,這類模型或將成為AI應用層的標準組件,而騰訊的佈局也體現了其在AI基礎設施上的持續投入。