通义千问(Qwen)团队于近日在Hugging Face平台发布了Qwen3-ASR系列开源语音识别模型,包含Qwen3-ASR-1.7B和Qwen3-ASR-0.6B两个参数规模的版本。该系列模型支持52种语言和方言的自动语种识别(Language Identification)与语音转文字(ASR)功能,覆盖中文、英文、粤语、阿拉伯语、德语、法语、西班牙语、葡萄牙语、印尼语、意大利语、韩语、俄语、泰语、越南语、日语、土耳其语、印地语、马来语、荷兰语、瑞典语、丹麦语、芬兰语、波兰语、捷克语、菲律宾语、波斯语、希腊语、匈牙利语、马其顿语、罗马尼亚语等30种语言,以及22种中国方言,包括安徽话、东北话、福建话、甘肃话、贵州话、河北话、河南话、湖北话、湖南话、江西话、宁夏话、山东话、陕西话、山西话、四川话、天津话、云南话、浙江话、香港粤语、广东粤语、吴语和闽南语。
据官方介绍,Qwen3-ASR-1.7B版本在开源ASR模型中达到了最先进性能(SOTA),并与当前最强的商业闭源API(如谷歌、微软、亚马逊等提供的语音识别服务)具有竞争力。其基础模型为Qwen3-Omni,后者具备强大的音频理解能力,为ASR任务提供了高质量的多模态基础。Qwen3-ASR-0.6B版本则更注重效率:在128并发条件下,吞吐量可达2000倍实时率,适合高并发、低延迟的部署场景。两个模型均支持流式推理与离线推理的统一模式,并能够处理长音频输入。
除了核心的语音识别功能,该系列还包含一个专门的Qwen3-ForcedAligner-0.6B模型,用于强制对齐(Forced Alignment)任务。该模型支持对11种语言(中文、英文、粤语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语)中最长5分钟的语音进行任意时间单位的时间戳预测,在精度上超越了基于端到端(E2E)的强制对齐模型。这一功能对语音合成、字幕生成、语音编辑等应用场景具有实用价值。
在技术实现上,Qwen3-ASR模型原生支持Hugging Face Transformers库(需版本≥5.13.0),开发者可通过`AutoProcessor`和`AutoModelForMultimodalLM`接口快速加载使用。模型支持通过`prompt`参数传入上下文或热词(hotwords),以优化特定领域词汇(如专业术语、人名)的识别准确率。用户还可以强制指定输出语言,或让模型自动检测语种。
从产业视角看,Qwen3-ASR的发布进一步丰富了AI基础设施层的开源语音工具链。此前,通义千问已在文本、视觉、多模态等领域推出多个开源模型,此次将语音识别能力以Apache-2.0许可证开放,降低了开发者构建多语种语音应用的门槛。对于AI应用层(如智能客服、会议转录、语音搜索、教育工具等),一个高性能、多语种、支持流式推理的开源ASR模型,可能加速相关产品的迭代与落地。同时,其与商业API的竞争力对比,也为企业在选择语音识别方案时提供了更多开源选项。