腾讯于 Hugging Face 平台正式发布 Ex-Omni 11B 模型,这是一个面向全模态(omni-modal)响应生成的开源项目。该系统能够接收文本或语音输入,并同步生成响应文本、语音单元(可解码为音频)以及 52 维面部 blendshape 系数,用户还可选择将其渲染为说话人脸视频,实现从语言到 3D 面部动画的端到端生成。
Ex-Omni 的模型参数规模为 11B,其研究论文由香港中文大学(深圳)的 Haoyu Zhang、Tianshu Yu,LIGHTSPEED 的 Zhipeng Li,以及独立研究者 Yiwen Guo 共同完成,论文已提交至 arXiv(编号 2602.07106)。项目在 Hugging Face 上的仓库显示,模型权重、代码及演示脚本均已开放,开发者可通过 `deploy.py` 启动本地 Gradio 演示,默认端口为 8080。
从技术架构看,Ex-Omni 整合了多个模块:语言模型负责核心推理,语音编码器(基于 Whisper)处理输入音频,语音投影器与生成器负责语音合成,而 blendshape 生成器则负责将语义映射到面部动画参数。渲染环节支持两种网格模板:EmoTalk(来自 UniTalker 项目)和 Claire(来自 NVIDIA Audio2Face 数据集),用户可根据需要选择。
值得注意的是,Ex-Omni 的语音解码部分复用了 GLM-4-Voice-Decoder 的 Flow 和 HiFT 检查点,后者由智谱 AI 开源。项目在致谢中明确提到,其实现参考了 OpenOmni、LLaMA-Omni2、EmoTalk 和 UniTalker 等开源项目,体现了当前多模态模型社区相互借鉴、快速迭代的特点。
从产业视角看,Ex-Omni 的发布将 3D 面部动画生成 直接融入大语言模型的输出管线,意味着 AI 助手不仅能“说话”,还能以带有面部表情的虚拟形象呈现。这对于数字人直播、虚拟客服、在线教育等应用场景具有潜在价值,可能降低开发者构建逼真交互界面的门槛。同时,该模型基于开源生态,开发者可自由修改和部署,有望加速多模态交互技术在消费级产品中的落地。
不过,Ex-Omni 目前仍属于研究性开源项目,其实际效果和稳定性有待社区验证。模型仓库中提示用户需自行下载网格模板并转换为 `.npz` 格式,安装过程也涉及 PyTorch3D 等依赖,部署存在一定技术门槛。此外,模型对计算资源的需求(11B 参数)意味着推理时可能需要较高配置的 GPU,这或将成为其在端侧设备上应用的制约因素。
总体而言,腾讯此次开源 Ex-Omni,延续了其在多模态大模型领域的技术布局,也为 AI 与 3D 视觉的交叉研究提供了一个可复现的基准。随着类似模型的不断涌现,AI 交互正从纯文本/语音向“语音+表情+动作”的复合形态演进,这或将重塑虚拟角色和智能助手的用户体验。