騰訊於 Hugging Face 平台正式釋出 Ex-Omni 11B 模型,這是一個面向全模態(omni-modal)響應生成的開源專案。該系統能夠接收文本或語音輸入,並同步生成響應文本、語音單元(可解碼為音訊)以及 52 維面部 blendshape 係數,使用者還可選擇將其渲染為說話人臉影片,實現從語言到 3D 面部動畫的端到端生成。

Ex-Omni 的模型引數規模為 11B,其研究論文由香港中文大學(深圳)的 Haoyu Zhang、Tianshu Yu,LIGHTSPEED 的 Zhipeng Li,以及獨立研究者 Yiwen Guo 共同完成,論文已提交至 arXiv(編號 2602.07106)。專案在 Hugging Face 上的倉庫顯示,模型權重、程式碼及演示指令碼均已開放,開發者可通過 `deploy.py` 啟動本地 Gradio 演示,預設埠為 8080。

從技術架構看,Ex-Omni 整合了多個模組:語言模型負責核心推理,語音編碼器(基於 Whisper)處理輸入音訊,語音投影器與生成器負責語音合成,而 blendshape 生成器則負責將語義對映到面部動畫引數。渲染環節支援兩種網格模板:EmoTalk(來自 UniTalker 專案)和 Claire(來自 NVIDIA Audio2Face 資料集),使用者可根據需要選擇。

值得注意的是,Ex-Omni 的語音解碼部分複用了 GLM-4-Voice-Decoder 的 Flow 和 HiFT 檢查點,後者由智譜 AI 開源。專案在致謝中明確提到,其實現參考了 OpenOmni、LLaMA-Omni2、EmoTalk 和 UniTalker 等開源專案,體現了當前多模態模型社群相互借鑑、快速迭代的特點。

從產業視角看,Ex-Omni 的釋出將 3D 面部動畫生成 直接融入大語言模型的輸出管線,意味著 AI 助手不僅能“說話”,還能以帶有面部表情的虛擬形象呈現。這對於數字人直播、虛擬客服、線上教育等應用場景具有潛在價值,可能降低開發者構建逼真互動介面的門檻。同時,該模型基於開源生態,開發者可自由修改和部署,有望加速多模態互動技術在消費級產品中的落地。

不過,Ex-Omni 目前仍屬於研究性開源專案,其實際效果和穩定性有待社群驗證。模型倉庫中提示使用者需自行下載網格模板並轉換為 `.npz` 格式,安裝過程也涉及 PyTorch3D 等依賴,部署存在一定技術門檻。此外,模型對計算資源的需求(11B 引數)意味著推理時可能需要較高配置的 GPU,這或將成為其在端側裝置上應用的制約因素。

總體而言,騰訊此次開源 Ex-Omni,延續了其在多模態大模型領域的技術佈局,也為 AI 與 3D 視覺的交叉研究提供了一個可復現的基準。隨著類似模型的不斷湧現,AI 互動正從純文本/語音向“語音+表情+動作”的複合形態演進,這或將重塑虛擬角色和智慧助手的使用者體驗。