通義千問(Qwen)團隊於近日在Hugging Face平台釋出了Qwen3-ASR系列開源語音識別模型,包含Qwen3-ASR-1.7BQwen3-ASR-0.6B兩個引數規模的版本。該系列模型支援52種語言和方言的自動語種識別(Language Identification)與語音轉文字(ASR)功能,覆蓋中文、英文、粵語、阿拉伯語、德語、法語、西班牙語、葡萄牙語、印尼語、義大利語、韓語、俄語、泰語、越南語、日語、土耳其語、印地語、馬來語、荷蘭語、瑞典語、丹麥語、芬蘭語、波蘭語、捷克語、菲律賓語、波斯語、希臘語、匈牙利語、馬其頓語、羅馬尼亞語等30種語言,以及22種中國方言,包括安徽話、東北話、福建話、甘肅話、貴州話、河北話、河南話、湖北話、湖南話、江西話、寧夏話、山東話、陝西話、山西話、四川話、天津話、雲南話、浙江話、香港粵語、廣東粵語、吳語和閩南語。

據官方介紹,Qwen3-ASR-1.7B版本在開源ASR模型中達到了最先進效能(SOTA),並與當前最強的商業閉源API(如谷歌、微軟、亞馬遜等提供的語音識別服務)具有競爭力。其基礎模型為Qwen3-Omni,後者具備強大的音訊理解能力,為ASR任務提供了高質量的多模態基礎。Qwen3-ASR-0.6B版本則更注重效率:在128併發條件下,吞吐量可達2000倍即時率,適合高併發、低延遲的部署場景。兩個模型均支援流式推理離線推理的統一模式,並能夠處理長音訊輸入。

除了核心的語音識別功能,該系列還包含一個專門的Qwen3-ForcedAligner-0.6B模型,用於強制對齊(Forced Alignment)任務。該模型支援對11種語言(中文、英文、粵語、法語、德語、義大利語、日語、韓語、葡萄牙語、俄語、西班牙語)中最長5分鐘的語音進行任意時間單位的時間戳預測,在精度上超越了基於端到端(E2E)的強制對齊模型。這一功能對語音合成、字幕生成、語音編輯等應用場景具有實用價值。

在技術實現上,Qwen3-ASR模型原生支援Hugging Face Transformers庫(需版本≥5.13.0),開發者可通過`AutoProcessor`和`AutoModelForMultimodalLM`介面快速載入使用。模型支援通過`prompt`引數傳入上下文或熱詞(hotwords),以最佳化特定領域詞彙(如專業術語、人名)的識別準確率。使用者還可以強制指定輸出語言,或讓模型自動檢測語種。

從產業視角看,Qwen3-ASR的釋出進一步豐富了AI基礎設施層的開源語音工具鏈。此前,通義千問已在文本、視覺、多模態等領域推出多個開源模型,此次將語音識別能力以Apache-2.0許可證開放,降低了開發者構建多語種語音應用的門檻。對於AI應用層(如智慧客服、會議轉錄、語音搜尋、教育工具等),一個高效能、多語種、支援流式推理的開源ASR模型,可能加速相關產品的迭代與落地。同時,其與商業API的競爭力對比,也為企業在選擇語音識別方案時提供了更多開源選項。