OpenAI 已把 GPT-Live-1 作為 API 開放給開發者。這是一款支援「全雙工」的語音模型,能夠一邊聽一邊說,目前已在 ChatGPT 內部執行。開發者可以根據任務需要,把它與不同的後端模型搭配使用,從而在推理深度、響應速度與成本之間做取捨。
定價方面,該 API 為每分鐘 0.05 美元,按語音模型的常規標準並不便宜。OpenAI 表示,完整細節將公佈在 API 文件中。
效能上,OpenAI 公佈的基準顯示 GPT-Live-1 明顯領先前代。在全雙工互動性測試中,它拿到 80.1%,而前代 GPT-Realtime-2.1 為 45.4%;輪次切換延遲從 1.4 秒降到 0.8 秒;工具呼叫準確率從 60% 提升到 87%。在一項銀行語音支援基準中,GPT-Live-1 的通過率為 32%,前代模型為 12.4%。
功能層面,GPT-Live-1 附帶 12 種新語音,覆蓋不同口音、方言和語言,並開箱提供 ASR 轉寫與回覆文本。
應用側已有落地案例。據 Yelp 技術長 Alex Levy 介紹,Yelp 正把該模型用於電話預訂,並反饋通話處理效果有所改善。
從產業視角看,全雙工語音的關鍵意義在於互動範式的改變。傳統語音助手採用「輪流說話」模式:使用者說完,系統才處理並回應,中間存在明顯停頓。全雙工讓模型在使用者說話的同時持續接收與生成,更接近真人對話的節奏。延遲從 1.4 秒降到 0.8 秒,看似只是零點幾秒的差別,但在電話客服、預訂、預約這類場景中,停頓長短直接決定使用者是否願意繼續用下去。
工具呼叫準確率從 60% 升到 87%,則關係到語音 Agent 能否真正完成任務,而不只是聊天。語音場景下,模型需要呼叫訂位、查詢、改簽等外部系統,調用出錯就意味著任務失敗。銀行語音支援通過率從 12.4% 升到 32% 雖仍不算高,但已是前代的兩倍多,說明在合規要求高、流程複雜的場景中,語音模型開始具備可用性。
定價每分鐘 0.05 美元,對高頻通話業務是一筆需要計算的成本。這也解釋了 OpenAI 為何強調開發者可以搭配不同後端模型:簡單任務用輕量模型壓低成本,複雜任務再呼叫更強推理能力,形成分層架構。
對產業鏈而言,這類模型的成熟會同時影響兩端。上游是即時推理算力與語音基礎設施的需求,下游則是客服、本地服務、預訂平台等應用層的產品形態。Yelp 的電話預訂案例表明,語音 Agent 正從演示走向實際業務。後續值得關注的是,其他平台是否會跟進類似整合,以及 0.05 美元每分鐘的定價能否隨競爭下降。