谷歌 DeepMind 于 9 月 15 日发布两款实时语音对话模型——Gemini 3.8 LiveGemini 3.8 Live Extended Thinking,并称这是其迄今最先进的实时对话模型。两款模型即日起通过 Gemini APIGoogle WorkspaceGemini 应用向用户开放,开发者与企业可直接调用。

两款模型定位不同。Gemini 3.8 Live 面向规模化与成本效率,把对话智能、流畅语音与视觉理解结合在一起;Gemini 3.8 Live Extended Thinking 则面向高复杂度任务,强调更强的智能水平与多步推理能力。谷歌表示,对开发者与企业而言,这两款模型提供了构建可靠、可投入生产的语音智能体的基础模块。

在性能指标上,谷歌给出的数据颇为具体。Gemini 3.8 Live Extended ThinkingArtificial Analysis 语音到语音质量指数上以 82.6 分拿下整体第一;在代理任务完成度上,τ-Voice 得分 68.6%Sierra 的 τ-Voice-banking 基准得分 35.1%;推理能力方面,Big Bench Audio 得分 97.7%。谷歌同时强调,该模型在与其他前沿模型相比时仍保持有竞争力的价格。Gemini 3.8 Live 则在 Speech Agent Arena 中位列第二,谷歌称其用户偏好度较高,且成本效益突出。

ServiceNow 的 EVA-Bench 语音智能体评测中,谷歌称这两款模型在复杂工作流上推进了帕累托前沿,在准确性与对话质量之间取得平衡。该测试运行于 Gemini Enterprise Agent Platform 上的 Live API

功能层面,Gemini 3.8 Live 能近实时处理视觉输入,为对话补充上下文;可在对话中途自动检测并切换 97 种支持语言;还能在继续对话的同时于后台执行工具与 API 调用,模型可以先行确认请求、随后在任务完成时继续聊天。谷歌展示了多个演示场景,包括用视觉上下文实时引导员工入职、以及近实时下棋。

对于需要更深推理的任务,3.8 Live Extended Thinking 做到边推理边说话。它在处理复杂工作流时保持对话不中断,会用「让我查一下……」这类早期口头提示自然确认用户请求,并通过实时进度叙述引导用户了解多步后台任务的进展。演示场景包括把草图与近实时语音反馈转化为可用的 React 组件、协调多步预订与异步函数调用,以及通过自然语音即时生成完整商业计划和定制营销工具包。

在应用落地方面,谷歌把这两款模型嵌入 Google Workspace搜索。用户可在 Workspace 中通过 Docs LiveGmail LiveKeep Live 体验 Gemini 3.8 Live Extended Thinking;在 Search Live 中,Gemini 3.8 Live 可提供分步骤的实时故障排查帮助。

开发者生态方面,谷歌表示通过 Gemini Live APIAgoraFishjamLiveKitPipecatVercelVision Agents 等开发者平台已能接入相关能力。

从产业视角看,这次发布把语音交互从「能听懂」推向「能边想边说、边做边说」。实时视觉理解、多语言中途切换与后台任务执行三项能力叠加,意味着语音智能体可以承担更接近真实助理的工作流,而不再局限于问答。对谷歌而言,把模型同时铺到 API、Workspace 与搜索,是在用自有分发渠道为语音智能体生态铺路;对开发者平台与语音基础设施厂商来说,接入 Gemini Live API 也意味着其产品能力边界被重新定义。语音入口的竞争,正在从模型分数延伸到谁能更快把实时推理与工具调用做成可规模化交付的生产力工具。