微軟研究院近日在 Hugging Face 上釋出了 VibeVoice-ASR-BitNet,這是一個專為邊緣 CPU 即時推理最佳化的自動語音識別(ASR)模型。作為 VibeVoice-ASR 的壓縮變體,該模型通過異構量化技術,將模型體積從原始的 4.62 GB 大幅壓縮至 1.58 GB,壓縮比達到 2.9 倍,使其能夠輕鬆適配邊緣裝置的儲存限制。

VibeVoice-ASR-BitNet 的核心亮點在於無需 GPU 即可在 CPU 上實現即時推理。根據微軟公佈的基準測試,在配備 AVX2 指令集的 x86 平台(如 AMD EPYC 7V13)以及 ARM 平台的 NEON 架構上,僅需 3 個 CPU 執行緒即可達到即時處理速度(RTF=1)。在單執行緒下,其推理速度已是 Whisper.cpp 的 2.28 倍;隨著執行緒數增加,速度優勢穩定在 1.55 至 2.12 倍之間。這一效能突破得益於微軟為 ggml 框架定製的 SIMD 核心,在 ARM 和 x86 平台上均實現了融合運算元最佳化。

在精度方面,VibeVoice-ASR-BitNet 在多個公開基準上展現了與原始模型相近的表現。例如,在英語基準 MLC-EN 上,詞錯誤率(WER)為 8.25%,略高於原始 VibeVoice-ASR-7B 的 7.82%,但優於 Parakeet(8.40%)、Whisper(13.57%)和 SenseVoice(12.39%)等競品。在中文基準 AISHELL4 上,其 WER 為 27.45%,雖不及 FunASR(22.52%)和 SenseVoice(20.41%),但在多語言場景下保持了競爭力。該模型支援 英語、中文、法語、義大利語、韓語、葡萄牙語、越南語 等多種語言,覆蓋了主要使用場景。

該模型的量化策略分為兩部分:VAE Tokenizer 採用 I8_S 量化,從 1.31 GB 壓縮至 0.65 GB(2.0 倍壓縮);LM Decoder 則採用 I2_S + Q6_K 混合量化,從 3.32 GB 壓縮至 0.92 GB(3.6 倍壓縮)。最終模型以兩個 GGUF 檔案形式提供,可直接在支援 ggml 的推理框架中載入使用。微軟同時釋出了配套的推理程式碼庫 VibeASR.cpp 以及詳細的技術報告,方便開發者進行部署和二次開發。

從產業視角看,VibeVoice-ASR-BitNet 的釋出標誌著語音識別模型向邊緣端部署邁出了重要一步。此前,高質量的即時 ASR 通常依賴雲端 GPU 或專用加速硬體,而該模型在普通 CPU 上即可實現同等效果,這為智慧家居、車載系統、可穿戴裝置等對功耗和成本敏感的場景提供了新的技術選擇。同時,MIT 許可證的採用也降低了商業整合的門檻。對於 AI 基礎設施層而言,這類高效模型的出現將進一步推動算力需求從雲端向邊緣端分流,可能影響資料中心 GPU 需求的增長節奏,但同時也為晶片廠商(如 Intel、AMD 的 CPU 產品線)在 AI 推理領域創造了新的市場空間。