谷歌 DeepMind 於 9 月 24 日釋出 Gemini 3.8 Live with Live Avatar,在上一週 Gemini 3.8 Live 的基礎上,為原生即時對話模型加上「視覺存在感」。官方稱,該功能把近即時影片生成與語音結合,讓 AI 能聽、能看、能說,並以帶有動態視覺形象的方式與使用者交流,即日起在 Gemini Enterprise 中可用。

從技術路徑看,Live Avatar 的核心是把即時對話能力與低延遲流式影片原生耦合。它同時處理視覺與音訊輸入,再輸出帶表情的音訊與影片,從而實現精確口型同步、自然表情和流暢的對話輪替。谷歌方面表示,這能讓企業把虛擬服務做得更具互動性,例如客戶服務或互動式導覽,把原本偏靜態的數字交流變成更豐富、更易接觸的體驗。

一個值得注意的設計是「非同步工具呼叫」。Live Avatar 由 Gemini 的推理能力支撐,可以在對話持續進行的同時,在後台觸發工具呼叫並獲取資料。官方演示的場景是酒店入住辦理:系統一邊與客人對話,一邊在後台完成查詢等操作,避免因等待資料而中斷交流。對企業而言,這意味著數字人不再只是「會說話的介面」,而是能承接多步驟任務的互動入口。

語言覆蓋是另一項賣點。Live Avatar 具備原生的多語言語音到語音同步能力,可動態調整口型與表情,並在 97 種語言之間無縫切換,官方稱切換過程不會降低影片清晰度,也不會出現視覺漂移。演示中,數字人可以在同一段對話裡中途換語言,口型與表情隨之適配。

在品牌定製方面,除了一批預設的多樣化數字人形象,企業還可以自定義 Live Avatar:開發者可基於一張高質量參考圖,生成完整動畫化、可響應的數字人,同時保留參考人物的相貌、品牌風格或角色設定。不過,自定義數字人目前僅通過企業白名單開放。

信任與透明度方面,谷歌強調 Live Avatar 內建了尊重身份的設計與防護措施,所有 AI 產品生成的輸出都帶有 SynthID 水印。這種不可感知的水印直接嵌入音訊與影片輸出,目的是讓 AI 生成內容可被檢測,以減少誤傳與錯誤歸屬。官方同時引導開發者查閱模型卡,瞭解其安全與負責任部署的整體思路。

把這條釋出放回產業語境,可以看到幾條線索。其一,即時多模態互動正從「語音助手」向「有形象、有表情、能邊聊邊幹活」演進,企業級客服、培訓、導覽等場景是最先被瞄準的落點。其二,即時影片生成與語音同步對推理時延和算力提出更高要求,這類功能的普及節奏,會與底層推理基礎設施的供給能力相互牽動。其三,SynthID 水印與自定義形象的白名單機制,反映出廠商在「可定製」與「防濫用」之間尋找平衡,這也會影響企業客戶在合規敏感行業中的採用意願。

目前該功能定位在企業側,尚未提及面向普通消費者的開放計劃。對關注 AI 應用層的人來說,接下來值得觀察的是:企業客戶會把它用在哪些具體流程裡、非同步工具呼叫的實際穩定性如何,以及多語言即時數字人在真實網路條件下的表現是否如演示般流暢。