OpenAI 正式推出新一代語音模型 GPT‑Live 系列,將 ChatGPT 的語音對話能力推向更接近真人交流的水平。與此前依賴多模型串接或回合式互動的方案不同,GPT‑Live 採用雙向架構,能夠在生成語音輸出的同時持續處理使用者的語音輸入,模型自行決定何時說話、何時繼續聆聽,從而擺脫了“等對方說完才回應”的僵硬節奏。

在實際對話中,GPT‑Live 會使用“對”“嗯”“瞭解”等簡短反饋來表明正在聆聽,也會在使用者需要思考時安靜等待。使用者不僅可以隨時插話提問、暫停整理思緒,還能直接要求模型放慢說話速度。OpenAI 還為 GPT‑Live 重新制作了 9 種各具特色的聲音,以豐富聽覺體驗。

當用戶的問題需要聯網搜尋、深度推理或處理更復雜任務時,GPT‑Live 會在後台將請求轉交給 GPT‑5.5 等更先進的模型處理,待結果生成後再無縫帶回對話中。這種“前台語音互動 + 後台強模型排程”的架構,既保持了語音對話的流暢感,又確保了回答質量不因模型規模受限。

OpenAI 此次向全球 ChatGPT 使用者推出兩個版本:GPT‑Live‑1GPT‑Live‑1 mini,並計劃很快在 API 中開放 GPT‑Live 的訪問許可權,這意味著開發者將能把這一雙向語音能力整合到自己的應用與服務中。

從技術演進的角度看,GPT‑Live 的釋出是 AI 語音系統的一次重要躍遷。早期的 ChatGPT 語音功能採用串接式架構,依次呼叫語音轉文字模型、大語言模型和文字轉語音模型,資訊在模型間傳遞時容易流失,響應緩慢且生硬。後來的進階語音模式升級為回合式語音模型,在單一模型內處理並生成音訊,降低了延遲,但仍以對話回合為單位,模型必須等待使用者停止說話才能回應,停頓或背景噪音還可能被誤判為回合結束,導致不自然的插話。GPT‑Live 的雙向架構則實現了連續互動,模型不再逐條處理彼此獨立的訊息,而是持續處理輸入並生成輸出,能夠更準確地把握對話節奏,甚至提供即時翻譯。

OpenAI 透露,目前每週已有超過 1.5 億人通過語音和聽寫等功能與 ChatGPT 對話,語音互動正變得越來越普遍。GPT‑Live 的推出旨在改善此前互動中仍存在的不流暢問題,讓使用者無需動手輸入,開口就能與 ChatGPT 聊天、練習語言或獲取協助。

在安全層面,當 ChatGPT 檢測到可能產生不安全輸出時,會引導 GPT‑Live 給出更安全的回應、顯示額外的安全資訊或資源,或在較高風險情況下結束語音對話。針對涉及自我傷害的對話,OpenAI 已將 ChatGPT 的支援流程調整為適用於語音,包括提供經專家稽核的求助專線

GPT‑Live 的釋出也被外界視為對 Google 旗下 Gemini Live 的直接競爭回應。隨著雙向語音模型的落地,AI 語音助手、即時翻譯、語言學習等應用場景的體驗有望大幅提升,語音互動或將成為使用者接觸 AI 模型的主流入口之一。