7月31日,阿里巴巴发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,聚焦通用语音识别能力的系统性升级,重点解决长音频场景下的上下文一致性、行业词识别和热词定制化三大痛点,同时新增语音润色能力,可直接输出结构化文本。该模型即日起在阿里云百炼平台开放调用。

在会议、访谈、课程、直播等长音频场景中,专业术语和英文词汇往往无法仅凭当前几秒的语音准确判断,同一发音可能对应多个同音词。Qwen-Audio-3.0-ASR-Flash新增长音频Context能力,模型在转写当前片段时可参考近期已识别的上下文,延续同一话题中的关键词与语义线索,从而减少同音词误判,提升术语和中英文混合表达的识别准确率。例如,在长达数小时的会议录音中,发言人的名字或技术概念不会因跨片段而被遗忘或认错。

针对行业词识别,传统方案依赖人工维护词表,而新模型将这一过程内化为自身能力,无需人工逐一设置即可在真实业务场景中持续进化。研究团队通过持续挖掘医疗、IT编程、股票、社会名人等领域的实体词,构建了覆盖多行业的高质量词库,并基于这些实体词合成训练数据,增强模型对专业术语和低频词的识别能力。在最新的行业词汇内部评测中,新模型的行业词召回率显著提升,其中医疗场景突破95.36%

热词定制方面,传统方案常面临热词加得越多、误触发越多的矛盾。Qwen-Audio-3.0-ASR-Flash采用模型结合声学证据与上下文进行智能判断的方式,而非简单替换。在传入热词的条件下,热词定制化准确率在所有测试集均达到90%以上,多数场景突破99%

此外,新模型还具备语音润色能力:口语中的“那个”“嗯”等填充词被直接去除;说话时的自我修正(如“我们下周三评审,不对,是周四”)只保留最终意图;散乱的口述可自动整理为结构化表达。这些润色由ASR模型在识别环节一步完成,无需再调用下游文本大模型,链路更短、延迟更低、使用成本也更低。

目前,Qwen-Audio-ASR系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景中获得广泛验证,其离线版本曾在全球权威AI评测平台Artificial Analysis1.7%的错字率位列全球第一。此次3.0版本的发布,进一步强化了模型在复杂语境和垂直领域的识别能力,有望降低行业用户部署ASR的门槛,推动语音识别技术在更多专业场景的落地。