9月28日,在全球权威AI评测平台Artificial Analysis的语音排行榜(Controlled Voice Arena)上,阿里巴巴近期发布的语音大模型Qwen-Audio-3.1-TTS以1177的Elo评分位列全球第一。这一榜单以受控语音竞技场形式对模型进行盲测比较,其排名常被业界视为衡量语音合成自然度与表现力的重要参考。

Qwen-Audio-3.1-TTS是阿里新一代语音合成大模型,支持多语种及方言合成。其一项突出能力是让同一音色在不同语言之间自然迁移,即用一种声音自然讲出多种语言。相比传统语音合成主要关注字音是否正确,该模型更强调声音是否符合具体内容和使用场景;用户可通过指令控制情绪、语速和表达方式,让合成语音不只“说得对”,也能“说得像”。

此次登顶的是阿里在2026云栖大会发布的Qwen-Audio-3.1系列中的TTS模型。该系列还包括语音转写(ASR)和实时语音交互(Realtime)两类模型,三大模型的API服务均已上架千问AI平台。此外,阿里语音团队开源的多款模型也在持续对外释放。

从产业视角看,语音合成正从“能听清”向“有表现力、可指令控制”演进,多语种与音色迁移能力对出海应用、内容创作、智能客服与实时交互场景尤为关键。阿里将TTS、ASR与Realtime三类能力同时以API形式开放,意味着开发者可以在同一平台上组合语音输入、合成与实时对话能力,降低语音应用的门槛。对关注AI应用层的投资者而言,权威三方评测的排名与API开放节奏,是观察国内语音模型竞争力与商业化落地进展的两个可跟踪信号。