阿里巴巴旗下通義千問團隊的最新文本轉語音模型 Qwen-Audio-3.0-TTS-Plus 在第三方評測機構 Artificial Analysis 的 Speech Arena 排行榜中登頂,以 Elo 評分 1236 的成績位居“供應商語音”類別首位,僅以 2 分之差領先於此前領先的 SpeechifyAI 的 Simba 3.2(1234)。谷歌的 Gemini 3.1 Flash TTS(1214)和 Sonic 3.5(1207)分列第三、四位。
該模型提供兩個版本:Flash 版針對即時互動場景最佳化,延遲約 300 毫秒;Plus 版則專注於高質量語音輸出。在語言支援方面,Qwen-Audio-3.0-TTS-Plus 覆蓋 16 種語言,包括他加祿語、馬來語、泰語、越南語等較少被主流 TTS 模型覆蓋的語言,以及多種中文方言。使用者可通過自然語言描述或新增類似 `[angry]`、`[giggles]` 的非語言標籤來精細控制說話風格。阿里還表示,該模型在語音克隆任務中,對帶有噪音或回聲的參考錄音處理能力優於前代。
不過,生成速度是該模型的一個明顯短板:其輸出速度僅為 16 字元/秒,遠低於 Sonic 3.5 的 120 字元/秒 和 Simba 3.2 的 30.2 字元/秒。這意味著在需要快速批次生成語音的場景下,阿里模型可能不佔優勢。定價方面,通過阿里雲模型服務平台呼叫,價格為 每百萬字元 27.60 美元。
此次登榜反映出阿里在語音 AI 領域的技術積累正在轉化為可量化的競爭力。對於 AI 產業投資者而言,TTS 是語音助手、有聲內容生成、虛擬人等應用的關鍵基礎能力,阿里在該賽道取得領先,可能帶動其雲服務與 AI 應用生態的進一步增長。同時,速度與質量的權衡也表明,不同廠商在 TTS 技術路線上存在差異化選擇——阿里更側重音質與風格控制,而 Sonic 等競品則優先保證吞吐量。