7月31日,阿里巴巴釋出語音識別大模型Qwen-Audio-3.0-ASR-Flash,聚焦通用語音識別能力的系統性升級,重點解決長音訊場景下的上下文一致性、行業詞識別和熱詞定製化三大痛點,同時新增語音潤色能力,可直接輸出結構化文本。該模型即日起在阿里雲百鍊平台開放呼叫。

在會議、訪談、課程、直播等長音訊場景中,專業術語和英文詞彙往往無法僅憑當前幾秒的語音準確判斷,同一發音可能對應多個同音詞。Qwen-Audio-3.0-ASR-Flash新增長音訊Context能力,模型在轉寫當前片段時可參考近期已識別的上下文,延續同一話題中的關鍵詞與語義線索,從而減少同音詞誤判,提升術語和中英文混合表達的識別準確率。例如,在長達數小時的會議錄音中,發言人的名字或技術概念不會因跨片段而被遺忘或認錯。

針對行業詞識別,傳統方案依賴人工維護詞表,而新模型將這一過程內化為自身能力,無需人工逐一設定即可在真實業務場景中持續進化。研究團隊通過持續挖掘醫療、IT程式設計、股票、社會名人等領域的實體詞,構建了覆蓋多行業的高質量詞庫,並基於這些實體詞合成訓練資料,增強模型對專業術語和低頻詞的識別能力。在最新的行業詞彙內部評測中,新模型的行業詞召回率顯著提升,其中醫療場景突破95.36%

熱詞定製方面,傳統方案常面臨熱詞加得越多、誤觸發越多的矛盾。Qwen-Audio-3.0-ASR-Flash採用模型結合聲學證據與上下文進行智慧判斷的方式,而非簡單替換。在傳入熱詞的條件下,熱詞定製化準確率在所有測試集均達到90%以上,多數場景突破99%

此外,新模型還具備語音潤色能力:口語中的“那個”“嗯”等填充詞被直接去除;說話時的自我修正(如“我們下週三評審,不對,是週四”)只保留最終意圖;散亂的口述可自動整理為結構化表達。這些潤色由ASR模型在識別環節一步完成,無需再呼叫下游文本大模型,鏈路更短、延遲更低、使用成本也更低。

目前,Qwen-Audio-ASR系列已在會議紀要整理、即時字幕、教育錄播、智慧客服等場景中獲得廣泛驗證,其離線版本曾在全球權威AI評測平台Artificial Analysis1.7%的錯字率位列全球第一。此次3.0版本的釋出,進一步強化了模型在複雜語境和垂直領域的識別能力,有望降低行業使用者部署ASR的門檻,推動語音識別技術在更多專業場景的落地。