阿里巴巴旗下通义千问团队的最新文本转语音模型 Qwen-Audio-3.0-TTS-Plus 在第三方评测机构 Artificial Analysis 的 Speech Arena 排行榜中登顶,以 Elo 评分 1236 的成绩位居“供应商语音”类别首位,仅以 2 分之差领先于此前领先的 SpeechifyAI 的 Simba 3.2(1234)。谷歌的 Gemini 3.1 Flash TTS(1214)和 Sonic 3.5(1207)分列第三、四位。

该模型提供两个版本:Flash 版针对实时交互场景优化,延迟约 300 毫秒;Plus 版则专注于高质量语音输出。在语言支持方面,Qwen-Audio-3.0-TTS-Plus 覆盖 16 种语言,包括他加禄语、马来语、泰语、越南语等较少被主流 TTS 模型覆盖的语言,以及多种中文方言。用户可通过自然语言描述或添加类似 `[angry]`、`[giggles]` 的非语言标签来精细控制说话风格。阿里还表示,该模型在语音克隆任务中,对带有噪音或回声的参考录音处理能力优于前代。

不过,生成速度是该模型的一个明显短板:其输出速度仅为 16 字符/秒,远低于 Sonic 3.5 的 120 字符/秒 和 Simba 3.2 的 30.2 字符/秒。这意味着在需要快速批量生成语音的场景下,阿里模型可能不占优势。定价方面,通过阿里云模型服务平台调用,价格为 每百万字符 27.60 美元

此次登榜反映出阿里在语音 AI 领域的技术积累正在转化为可量化的竞争力。对于 AI 产业投资者而言,TTS 是语音助手、有声内容生成、虚拟人等应用的关键基础能力,阿里在该赛道取得领先,可能带动其云服务与 AI 应用生态的进一步增长。同时,速度与质量的权衡也表明,不同厂商在 TTS 技术路线上存在差异化选择——阿里更侧重音质与风格控制,而 Sonic 等竞品则优先保证吞吐量。