谷歌 DeepMind 於 9 月 15 日釋出兩款即時語音對話模型——Gemini 3.8 LiveGemini 3.8 Live Extended Thinking,並稱這是其迄今最先進的即時對話模型。兩款模型即日起通過 Gemini APIGoogle WorkspaceGemini 應用向用戶開放,開發者與企業可直接呼叫。

兩款模型定位不同。Gemini 3.8 Live 面向規模化與成本效率,把對話智慧、流暢語音與視覺理解結合在一起;Gemini 3.8 Live Extended Thinking 則面向高複雜度任務,強調更強的智慧水平與多步推理能力。谷歌表示,對開發者與企業而言,這兩款模型提供了構建可靠、可投入生產的語音智慧體的基礎模組。

在效能指標上,谷歌給出的資料頗為具體。Gemini 3.8 Live Extended ThinkingArtificial Analysis 語音到語音質量指數上以 82.6 分拿下整體第一;在代理任務完成度上,τ-Voice 得分 68.6%Sierra 的 τ-Voice-banking 基準得分 35.1%;推理能力方面,Big Bench Audio 得分 97.7%。谷歌同時強調,該模型在與其他前沿模型相比時仍保持有競爭力的價格。Gemini 3.8 Live 則在 Speech Agent Arena 中位列第二,谷歌稱其使用者偏好度較高,且成本效益突出。

ServiceNow 的 EVA-Bench 語音智慧體評測中,谷歌稱這兩款模型在複雜工作流上推進了帕累託前沿,在準確性與對話質量之間取得平衡。該測試運行於 Gemini Enterprise Agent Platform 上的 Live API

功能層面,Gemini 3.8 Live 能近即時處理視覺輸入,為對話補充上下文;可在對話中途自動檢測並切換 97 種支援語言;還能在繼續對話的同時於後台執行工具與 API 呼叫,模型可以先行確認請求、隨後在任務完成時繼續聊天。谷歌展示了多個演示場景,包括用視覺上下文即時引導員工入職、以及近即時下棋。

對於需要更深推理的任務,3.8 Live Extended Thinking 做到邊推理邊說話。它在處理複雜工作流時保持對話不中斷,會用「讓我查一下……」這類早期口頭提示自然確認使用者請求,並通過即時進度敘述引導使用者瞭解多步後台任務的進展。演示場景包括把草圖與近即時語音反饋轉化為可用的 React 元件、協調多步預訂與非同步函式呼叫,以及通過自然語音即時生成完整商業計劃和定製營銷工具包。

在應用落地方面,谷歌把這兩款模型嵌入 Google Workspace搜尋。使用者可在 Workspace 中通過 Docs LiveGmail LiveKeep Live 體驗 Gemini 3.8 Live Extended Thinking;在 Search Live 中,Gemini 3.8 Live 可提供分步驟的即時故障排查幫助。

開發者生態方面,谷歌表示通過 Gemini Live APIAgoraFishjamLiveKitPipecatVercelVision Agents 等開發者平台已能接入相關能力。

從產業視角看,這次釋出把語音互動從「能聽懂」推向「能邊想邊說、邊做邊說」。即時視覺理解、多語言中途切換與後台任務執行三項能力疊加,意味著語音智慧體可以承擔更接近真實助理的工作流,而不再侷限於問答。對谷歌而言,把模型同時鋪到 API、Workspace 與搜尋,是在用自有分發渠道為語音智慧體生態鋪路;對開發者平台與語音基礎設施廠商來說,接入 Gemini Live API 也意味著其產品能力邊界被重新定義。語音入口的競爭,正在從模型分數延伸到誰能更快把即時推理與工具呼叫做成可規模化交付的生產力工具。