9月28日,在全球權威AI評測平台Artificial Analysis的語音排行榜(Controlled Voice Arena)上,阿里巴巴近期釋出的語音大模型Qwen-Audio-3.1-TTS以1177的Elo評分位列全球第一。這一榜單以受控語音競技場形式對模型進行盲測比較,其排名常被業界視為衡量語音合成自然度與表現力的重要參考。

Qwen-Audio-3.1-TTS是阿里新一代語音合成大模型,支援多語種及方言合成。其一項突出能力是讓同一音色在不同語言之間自然遷移,即用一種聲音自然講出多種語言。相比傳統語音合成主要關注字音是否正確,該模型更強調聲音是否符合具體內容和使用場景;使用者可通過指令控制情緒、語速和表達方式,讓合成語音不只“說得對”,也能“說得像”。

此次登頂的是阿里在2026雲棲大會釋出的Qwen-Audio-3.1系列中的TTS模型。該系列還包括語音轉寫(ASR)和即時語音互動(Realtime)兩類模型,三大模型的API服務均已上架千問AI平台。此外,阿里語音團隊開源的多款模型也在持續對外釋放。

從產業視角看,語音合成正從“能聽清”向“有表現力、可指令控制”演進,多語種與音色遷移能力對出海應用、內容創作、智慧客服與即時互動場景尤為關鍵。阿里將TTS、ASR與Realtime三類能力同時以API形式開放,意味著開發者可以在同一平台上組合語音輸入、合成與即時對話能力,降低語音應用的門檻。對關注AI應用層的投資者而言,權威三方評測的排名與API開放節奏,是觀察國內語音模型競爭力與商業化落地進展的兩個可跟蹤訊號。