腾讯旗下混元团队于Hugging Face平台发布了WeMM-Embedding-9B,一个通用多模态嵌入模型。该模型基于Qwen3.5-9B构建,能够处理文本、图像、视频、视觉文档以及交错多模态输入,并输出4096维的L2归一化嵌入向量。值得注意的是,模型不支持音频输入。在MMEB-v2基准的“任意到任意检索”任务中,WeMM-Embedding-9B取得了80.6分的整体得分,该结果已列入MMEB-v2排行榜。模型采用Apache 2.0开源许可,代码、模型参数及权重均公开可用。

WeMM-Embedding-9B的发布标志着腾讯在多模态嵌入技术上的又一进展。嵌入模型是将非结构化数据(如文本、图片、视频)转换为向量表示的关键组件,广泛应用于搜索、推荐、聚类等场景。该模型支持将不同模态的内容映射到同一向量空间,使得跨模态检索(如用文本搜图片、用图片搜视频)成为可能。其“任意到任意”的设计理念,旨在统一处理多种输入类型,简化应用开发流程。

从技术细节看,模型提供了灵活的集成方式。开发者可通过Transformers库或Sentence Transformers库调用,并支持Matryoshka嵌入(即截断维度以降低存储和计算成本),例如可指定256维嵌入。此外,模型还支持通过vLLMSGLang等推理框架进行服务化部署,便于生产环境使用。这些特性降低了多模态AI应用的门槛,尤其对需要处理海量多模态数据的企业具有吸引力。

在产业层面,多模态嵌入模型是AI基础设施的重要组成部分。随着视频、图像内容在互联网中的占比持续提升,高效的跨模态检索能力成为搜索、内容推荐、智能客服等应用的核心需求。腾讯此次推出的模型,直接对标市场上已有的多模态嵌入方案,如OpenAI的CLIP、谷歌的Universal Sentence Encoder等,但WeMM-Embedding-9B在参数量(9B)和输入模态多样性上更具优势。其基于Qwen3.5-9B的底座,也体现了腾讯与阿里在开源模型生态上的合作。

从竞争角度看,WeMM-Embedding-9B的发布可能加剧嵌入模型市场的竞争。目前,该领域已有多个开源模型,如BGE-M3、E5-Mistral等,但多模态嵌入模型仍相对稀缺。腾讯的入局,有望推动多模态检索技术的普及,并可能带动相关工具链(如向量数据库、检索增强生成)的发展。对于AI应用开发者而言,这意味着更多选择,但也需注意不同模型在特定任务上的性能差异。

值得注意的是,模型在MMEB-v2上的80.6分,反映了其在统一多模态检索任务上的基准表现,但实际效果还需在具体业务场景中验证。腾讯在模型卡中提供了详细的安装与使用说明,并附有技术报告引用,显示其工程化准备较为充分。未来,随着多模态数据的爆炸式增长,这类模型或将成为AI应用层的标准组件,而腾讯的布局也体现了其在AI基础设施上的持续投入。