微软研究院近日在 Hugging Face 上发布了 VibeVoice-ASR-BitNet,这是一个专为边缘 CPU 实时推理优化的自动语音识别(ASR)模型。作为 VibeVoice-ASR 的压缩变体,该模型通过异构量化技术,将模型体积从原始的 4.62 GB 大幅压缩至 1.58 GB,压缩比达到 2.9 倍,使其能够轻松适配边缘设备的存储限制。
VibeVoice-ASR-BitNet 的核心亮点在于无需 GPU 即可在 CPU 上实现实时推理。根据微软公布的基准测试,在配备 AVX2 指令集的 x86 平台(如 AMD EPYC 7V13)以及 ARM 平台的 NEON 架构上,仅需 3 个 CPU 线程即可达到实时处理速度(RTF=1)。在单线程下,其推理速度已是 Whisper.cpp 的 2.28 倍;随着线程数增加,速度优势稳定在 1.55 至 2.12 倍之间。这一性能突破得益于微软为 ggml 框架定制的 SIMD 内核,在 ARM 和 x86 平台上均实现了融合算子优化。
在精度方面,VibeVoice-ASR-BitNet 在多个公开基准上展现了与原始模型相近的表现。例如,在英语基准 MLC-EN 上,词错误率(WER)为 8.25%,略高于原始 VibeVoice-ASR-7B 的 7.82%,但优于 Parakeet(8.40%)、Whisper(13.57%)和 SenseVoice(12.39%)等竞品。在中文基准 AISHELL4 上,其 WER 为 27.45%,虽不及 FunASR(22.52%)和 SenseVoice(20.41%),但在多语言场景下保持了竞争力。该模型支持 英语、中文、法语、意大利语、韩语、葡萄牙语、越南语 等多种语言,覆盖了主要使用场景。
该模型的量化策略分为两部分:VAE Tokenizer 采用 I8_S 量化,从 1.31 GB 压缩至 0.65 GB(2.0 倍压缩);LM Decoder 则采用 I2_S + Q6_K 混合量化,从 3.32 GB 压缩至 0.92 GB(3.6 倍压缩)。最终模型以两个 GGUF 文件形式提供,可直接在支持 ggml 的推理框架中加载使用。微软同时发布了配套的推理代码库 VibeASR.cpp 以及详细的技术报告,方便开发者进行部署和二次开发。
从产业视角看,VibeVoice-ASR-BitNet 的发布标志着语音识别模型向边缘端部署迈出了重要一步。此前,高质量的实时 ASR 通常依赖云端 GPU 或专用加速硬件,而该模型在普通 CPU 上即可实现同等效果,这为智能家居、车载系统、可穿戴设备等对功耗和成本敏感的场景提供了新的技术选择。同时,MIT 许可证的采用也降低了商业集成的门槛。对于 AI 基础设施层而言,这类高效模型的出现将进一步推动算力需求从云端向边缘端分流,可能影响数据中心 GPU 需求的增长节奏,但同时也为芯片厂商(如 Intel、AMD 的 CPU 产品线)在 AI 推理领域创造了新的市场空间。