谷歌 DeepMind 于 9 月 24 日发布 Gemini 3.8 Live with Live Avatar,在上一周 Gemini 3.8 Live 的基础上,为原生实时对话模型加上「视觉存在感」。官方称,该功能把近实时视频生成与语音结合,让 AI 能听、能看、能说,并以带有动态视觉形象的方式与用户交流,即日起在 Gemini Enterprise 中可用。

从技术路径看,Live Avatar 的核心是把实时对话能力与低延迟流式视频原生耦合。它同时处理视觉与音频输入,再输出带表情的音频与视频,从而实现精确口型同步、自然表情和流畅的对话轮替。谷歌方面表示,这能让企业把虚拟服务做得更具互动性,例如客户服务或交互式导览,把原本偏静态的数字交流变成更丰富、更易接触的体验。

一个值得注意的设计是「异步工具调用」。Live Avatar 由 Gemini 的推理能力支撑,可以在对话持续进行的同时,在后台触发工具调用并获取数据。官方演示的场景是酒店入住办理:系统一边与客人对话,一边在后台完成查询等操作,避免因等待数据而中断交流。对企业而言,这意味着数字人不再只是「会说话的界面」,而是能承接多步骤任务的交互入口。

语言覆盖是另一项卖点。Live Avatar 具备原生的多语言语音到语音同步能力,可动态调整口型与表情,并在 97 种语言之间无缝切换,官方称切换过程不会降低视频清晰度,也不会出现视觉漂移。演示中,数字人可以在同一段对话里中途换语言,口型与表情随之适配。

在品牌定制方面,除了一批预设的多样化数字人形象,企业还可以自定义 Live Avatar:开发者可基于一张高质量参考图,生成完整动画化、可响应的数字人,同时保留参考人物的相貌、品牌风格或角色设定。不过,自定义数字人目前仅通过企业白名单开放。

信任与透明度方面,谷歌强调 Live Avatar 内置了尊重身份的设计与防护措施,所有 AI 产品生成的输出都带有 SynthID 水印。这种不可感知的水印直接嵌入音频与视频输出,目的是让 AI 生成内容可被检测,以减少误传与错误归属。官方同时引导开发者查阅模型卡,了解其安全与负责任部署的整体思路。

把这条发布放回产业语境,可以看到几条线索。其一,实时多模态交互正从「语音助手」向「有形象、有表情、能边聊边干活」演进,企业级客服、培训、导览等场景是最先被瞄准的落点。其二,实时视频生成与语音同步对推理时延和算力提出更高要求,这类功能的普及节奏,会与底层推理基础设施的供给能力相互牵动。其三,SynthID 水印与自定义形象的白名单机制,反映出厂商在「可定制」与「防滥用」之间寻找平衡,这也会影响企业客户在合规敏感行业中的采用意愿。

目前该功能定位在企业侧,尚未提及面向普通消费者的开放计划。对关注 AI 应用层的人来说,接下来值得观察的是:企业客户会把它用在哪些具体流程里、异步工具调用的实际稳定性如何,以及多语言实时数字人在真实网络条件下的表现是否如演示般流畅。