微軟在語音AI賽道加速補課。當地時間10月1日,微軟一次性發布三款語音模型:即時語音轉文字模型MAI-Transcribe-2-Streaming,以及文本轉語音模型MAI-Voice-2.1和延遲更低的MAI-Voice-2.1-Flash。其中,MAI-Transcribe-2-Streaming在AI基準測試平台Artificial Analysis的流式語音識別測試中拿下準確率第一。

據Artificial Analysis資料,MAI-Transcribe-2-Streaming的最終轉錄詞錯誤率(WER)為2.5%,在38款模型中排名第一,從說話結束到返回最終文本僅需約0.13秒;在更強調即時性的“首次部分轉錄”測試中,其WER同樣為2.5%,延遲約0.12秒。作為對比,此前排名第一的SpaceXAI Grok Voice Transcribe 2.0最終WER為2.7%、延遲0.49秒;Muse Voice Transcribe的WER為3.1%、延遲0.16秒;ElevenLabs Scribe v2 Realtime則為3.6%和0.14秒。

速度維度上微軟並非絕對領先。Artificial Analysis資料顯示,Cartesia Ink Preview的最終轉錄延遲約0.11秒,略快於微軟模型,但其WER為3.1%,準確率不及微軟。這意味著微軟此次登頂主要建立在準確率與延遲的綜合平衡上,而非單點極致。

即時轉錄:從“聽完再輸出”到“邊聽邊行動”

此次釋出的核心是MAI-Transcribe-2-Streaming。微軟稱,該模型支援60種語言,並能持續自動識別語言,不必等使用者一句話說完才開始輸出文字。與傳統語音轉文字模型“聽完—處理—輸出”的模式不同,流式模型會先快速生成部分轉錄結果,再隨更多語音資訊進入不斷修正,最終形成穩定文本。微軟表示,模型能在接收到音訊後100多毫秒就開始產生首批結果。

這一特性把語音AI的應用場景從單純“把聲音變成文字”推向即時互動。例如在客服場景中,AI智慧體可在使用者尚未說完一句話時就開始識別需求;語音助手則可提前進行推理、準備工具呼叫,而不是等使用者說完後才啟動整個處理流程。微軟稱,在即時聽寫和字幕等應用中,其內部測試顯示文字出現速度約為最接近競爭對手的兩倍。

定價:不走極致低價路線

價格方面,微軟為MAI-Transcribe-2-Streaming提供了每小時0.54美元的年末前優惠價,相當於每1000分鐘9美元,目前處於面向開發者的推廣階段。從Artificial Analysis的橫向比較看,這一價位處於主流流式語音模型價格的相對較高位置:與Gemini 3.5 Transcribe Live的約9美元/1000分鐘相當,高於ElevenLabs Scribe v2 Realtime和Deepgram Flux的約6.50美元,也明顯高於Cartesia Ink-2約4美元和Muse Voice Transcribe約3美元。

這顯示微軟此次並非單純以低價搶市場,而是試圖把準確率、延遲與企業級部署能力結合起來。作為背景,微軟此前9月推出的非流式MAI-Transcribe-2主打準確率、說話人識別、時間戳和複雜真實場景,支援60種語言;微軟當時稱該模型在FLEURS基準測試中平均WER為5.2%,並在Artificial Analysis的準確率與延遲測試中位於Pareto前沿。

語音輸出端:一個聲音跨語言保持一致

除轉錄模型外,微軟還發布MAI-Voice-2.1和MAI-Voice-2.1-Flash,分別對應更高的表達質量和更低的延遲。MAI-Voice-2.1支援23種語言、26個地區/語言環境,微軟強調同一個聲音可以跨語言保持一致,同時針對不同語言使用更自然的本地口音。這意味著開發者可以讓一個AI助手在英語、中文、德語等語言之間切換,而無需為每種語言配置不同的聲音。

定價上,MAI-Voice-2.1為每100萬字符22美元,更適合對語音表現力要求較高的場景;MAI-Voice-2.1-Flash面向對延遲和成本更敏感的應用,價格降至每100萬字符15美元。微軟稱,Flash版本模型推理速度提升55%,成本較可比模型低約60%。兩款模型均支援基於數秒參考音訊進行聲音克隆,並加入同意機制等安全措施。

從產品組合看,微軟實際上在同時壓縮語音AI互動的兩端延遲:MAI-Transcribe-2-Streaming負責快速“聽懂”,MAI-Voice-2.1-Flash負責快速“說出”。微軟稱,兩者結合後可為語音智慧體釋放更多時間用於推理、呼叫工具和檢查答案,同時保持接近自然人類對話的互動節奏。

自研模型矩陣持續擴張

此次釋出延續了微軟今年以來擴大MAI自研模型矩陣的動作。此前微軟已推出MAI-Transcribe-2、MAI-Voice-2、MAI-Thinking-1、MAI-Code-1.1-Flash以及MAI-Image系列模型,並逐步接入Microsoft Foundry以及Copilot、Teams、GitHub、Dynamics 365等產品和服務。其中,MAI-Transcribe-2目前已覆蓋會議記錄、影片字幕、客服文件、無障礙服務以及語音智慧體等場景;此次加入即時流式版本,意味著其自研模型的競爭重點正從單項識別準確率轉向即時語音智慧體的完整鏈路。

對微軟而言,這一方向的意義不止於增加幾個模型。隨著AI智慧體從文字互動走向電話客服、語音助手、即時翻譯和多模態工作流,語音識別與語音生成的延遲、準確率和成本都會直接影響使用者體驗與企業部署成本。此次MAI-Transcribe-2-Streaming在Artificial Analysis測試中登頂,至少顯示微軟在語音AI這一細分賽道正在加速追趕並進入第一梯隊。