阿里雲在7月15日上午正式釋出了新一代即時語音互動對話模型Qwen-Audio-3.0-Realtime,並同步推出了PlusFlash兩個版本。此次釋出標誌著即時語音模型競爭進入新階段,核心突破在於模型在保持毫秒級時延響應的同時,顯著提升了工具呼叫、多輪對話、情感表達和即時互動能力,解決了傳統語音助手“能聊天但不能辦事”的痛點。

新模型最顯著的特點是具備了自主呼叫工具的能力。在官方展示的路線規劃場景中,使用者無需發出“幫我查一下”這類明確指令,只需告知自己的時間安排和需求,模型便能理解上下文,自主判斷何時呼叫地圖工具。如果使用者行程中包含喝咖啡,它還能自動篩選附近評分高的咖啡館,並將獲取的資訊無縫融入後續的路線和時間規劃中。這種能力意味著語音助手從被動響應指令,轉向了主動理解任務目標並執行。

在互動體驗上,Qwen-Audio-3.0-Realtime也做出了重要改進。它支援可打斷的即時對話,使用者在模型輸出過程中可以隨時轉換問題,模型能及時跟上新思路進行連貫對話。同時,模型去掉了傳統語音助手的機械感,可根據對話語境動態調整語氣、節奏與情感,例如在使用者分享開心或難過的事情時,能以相應的情緒進行回應。

根據官方公佈的基準測試資料,該模型在多項指標上表現突出。在語音問答基準VoiceBench中,使用書面化標準提示詞和口語化提示詞提問,Qwen-Audio-3.0-Realtime Plus版本得分分別為92.590.5,差距僅2.0分,表明模型能很好地適應真人說話的隨意性。在考察“AI說得像不像人”的VStyle公開基準上,該模型取得了SOTA(當前最優)成績。此外,其Preview版本Fun-Realtime-Audiochat在今年5月曾以97.6%的語音推理能力和97.8%的對話流暢度,在Artificial Analysis平台上超越GPT-Realtime-2(High),雙雙登頂。

技術實現上,千問團隊透露,模型能在壓低時延的同時不掉智商,核心支撐來自線上策略蒸餾多教師蒸餾框架。研究團隊將文本大模型的完整推理能力蒸餾至語音模型,並通過四位專攻口語、通用問答、工具呼叫和音訊理解的“教師”模型進行多教師蒸餾,確保模型在多個維度上不偏科。此外,模型內建的“多模態感知的雙工控制”子模型,能通過分析音訊訊號和聲紋特徵,在嘈雜環境中避免誤打斷,並鎖定主對話物件。

在商業化方面,該模型按token計費,輸入音訊、輸出文本和輸出語音統一折算為token。價格上,Plus版輸入為5元/百萬token,輸出為40元/百萬tokenFlash版輸入為3元/百萬token,輸出為30元/百萬token。目前,模型可通過阿里雲百鍊平台呼叫API進行體驗。

此次Qwen-Audio-3.0-Realtime的釋出,反映出即時語音模型的競爭焦點已從單純的“低時延”轉向“高智商”與“真人般互動”。毫秒級響應成為基礎門檻,而能否自主呼叫工具、邊說邊聽、隨語境調整語氣,正成為衡量語音模型下一階段發展水平的關鍵。這對於AI應用層,尤其是智慧助手、智慧座艙、智慧家居等場景的體驗升級和商業化落地,具有直接的推動作用。