腾讯于 2026 年 2 月通过 Hugging Face 发布并开源了 9B 参数的多模态嵌入模型 WeMM-Embedding-9B。该模型基于 Qwen3.5 构建,能够同时处理文本、图像、视频、视觉文档以及交错的多模态输入,并输出 4096 维的 L2 归一化嵌入向量,但不支持音频输入。这一发布标志着腾讯在 AI 基础设施层(尤其是多模态检索与理解)的又一重要布局。
在技术指标上,WeMM-Embedding-9B 在两大主流基准上均取得了领先成绩。在 MMEB-v2 基准(涵盖 78 个数据集)上,其平均分达到 80.6,其中图像任务 Hit@1 为 81.9,视频任务为 74.3,视觉文档任务 NDCG@5 为 83.3,全面超越了同规模的 DME-Medium(78.4)以及更大规模的 VLM2Vec 8B(53.2)等模型。在更全面的 MMEB-v3 基准(覆盖 190 个任务,包含文本、智能体、跨模态检索等)上,其平均分达到 59.5,同样位居榜首,显著领先于 Qwen3-VL-Embedding 8B(53.5)等竞品。值得注意的是,MMEB-v3 中音频任务得分为 0,因为该模型不支持音频输入,但整体表现仍优于多数支持音频的模型。
WeMM-Embedding-9B 的设计强调通用性与实用性。它支持 Matryoshka 嵌入(MRL),允许用户通过截取嵌入向量的前若干维度(如 256 维)来降低存储与计算成本,同时保持较好的检索性能。模型兼容多种主流推理框架,包括 Transformers、Sentence Transformers、vLLM(0.27.0 及以上)以及 SGLang(0.5.9 及以上),并提供了详细的代码示例,便于开发者快速集成。此外,模型支持将文本、图像、视频等不同模态的内容混合编码,例如用户可以用文本查询去匹配包含图像或视频的文档,这为多模态检索增强生成(RAG)等应用提供了便利。
从产业视角看,多模态嵌入模型是连接视觉、语言与视频内容的关键技术,直接影响搜索、推荐、智能体记忆等上层应用的性能。腾讯此次开源 9B 级模型并登顶基准,不仅展示了其在多模态理解领域的技术积累,也可能对现有嵌入模型生态(如基于 CLIP 或纯文本嵌入的方案)形成竞争压力。对于 AI 应用开发者而言,一个开源、高性能且支持视频与文档的嵌入模型,有望降低多模态应用的开发门槛,并推动检索与生成技术的融合。
值得注意的是,该模型基于 Qwen3.5 底座,体现了腾讯与阿里在开源模型生态上的合作趋势。同时,腾讯在模型卡片中引用了技术报告,并鼓励社区引用,显示出其希望通过开源建立技术影响力的意图。不过,目前该模型尚未提供音频支持,这在一定程度上限制了其在全模态场景下的应用,未来是否会扩展音频能力值得关注。总体而言,WeMM-Embedding-9B 的发布是多模态 AI 基础设施领域的一个重要进展,其基准成绩与开源策略可能对行业产生持续影响。