微软在语音AI赛道加速补课。当地时间10月1日,微软一次性发布三款语音模型:实时语音转文字模型MAI-Transcribe-2-Streaming,以及文本转语音模型MAI-Voice-2.1和延迟更低的MAI-Voice-2.1-Flash。其中,MAI-Transcribe-2-Streaming在AI基准测试平台Artificial Analysis的流式语音识别测试中拿下准确率第一。
据Artificial Analysis数据,MAI-Transcribe-2-Streaming的最终转录词错误率(WER)为2.5%,在38款模型中排名第一,从说话结束到返回最终文本仅需约0.13秒;在更强调实时性的“首次部分转录”测试中,其WER同样为2.5%,延迟约0.12秒。作为对比,此前排名第一的SpaceXAI Grok Voice Transcribe 2.0最终WER为2.7%、延迟0.49秒;Muse Voice Transcribe的WER为3.1%、延迟0.16秒;ElevenLabs Scribe v2 Realtime则为3.6%和0.14秒。
速度维度上微软并非绝对领先。Artificial Analysis数据显示,Cartesia Ink Preview的最终转录延迟约0.11秒,略快于微软模型,但其WER为3.1%,准确率不及微软。这意味着微软此次登顶主要建立在准确率与延迟的综合平衡上,而非单点极致。
实时转录:从“听完再输出”到“边听边行动”
此次发布的核心是MAI-Transcribe-2-Streaming。微软称,该模型支持60种语言,并能持续自动识别语言,不必等用户一句话说完才开始输出文字。与传统语音转文字模型“听完—处理—输出”的模式不同,流式模型会先快速生成部分转录结果,再随更多语音信息进入不断修正,最终形成稳定文本。微软表示,模型能在接收到音频后100多毫秒就开始产生首批结果。
这一特性把语音AI的应用场景从单纯“把声音变成文字”推向实时交互。例如在客服场景中,AI智能体可在用户尚未说完一句话时就开始识别需求;语音助手则可提前进行推理、准备工具调用,而不是等用户说完后才启动整个处理流程。微软称,在实时听写和字幕等应用中,其内部测试显示文字出现速度约为最接近竞争对手的两倍。
定价:不走极致低价路线
价格方面,微软为MAI-Transcribe-2-Streaming提供了每小时0.54美元的年末前优惠价,相当于每1000分钟9美元,目前处于面向开发者的推广阶段。从Artificial Analysis的横向比较看,这一价位处于主流流式语音模型价格的相对较高位置:与Gemini 3.5 Transcribe Live的约9美元/1000分钟相当,高于ElevenLabs Scribe v2 Realtime和Deepgram Flux的约6.50美元,也明显高于Cartesia Ink-2约4美元和Muse Voice Transcribe约3美元。
这显示微软此次并非单纯以低价抢市场,而是试图把准确率、延迟与企业级部署能力结合起来。作为背景,微软此前9月推出的非流式MAI-Transcribe-2主打准确率、说话人识别、时间戳和复杂真实场景,支持60种语言;微软当时称该模型在FLEURS基准测试中平均WER为5.2%,并在Artificial Analysis的准确率与延迟测试中位于Pareto前沿。
语音输出端:一个声音跨语言保持一致
除转录模型外,微软还发布MAI-Voice-2.1和MAI-Voice-2.1-Flash,分别对应更高的表达质量和更低的延迟。MAI-Voice-2.1支持23种语言、26个地区/语言环境,微软强调同一个声音可以跨语言保持一致,同时针对不同语言使用更自然的本地口音。这意味着开发者可以让一个AI助手在英语、中文、德语等语言之间切换,而无需为每种语言配置不同的声音。
定价上,MAI-Voice-2.1为每100万字符22美元,更适合对语音表现力要求较高的场景;MAI-Voice-2.1-Flash面向对延迟和成本更敏感的应用,价格降至每100万字符15美元。微软称,Flash版本模型推理速度提升55%,成本较可比模型低约60%。两款模型均支持基于数秒参考音频进行声音克隆,并加入同意机制等安全措施。
从产品组合看,微软实际上在同时压缩语音AI交互的两端延迟:MAI-Transcribe-2-Streaming负责快速“听懂”,MAI-Voice-2.1-Flash负责快速“说出”。微软称,两者结合后可为语音智能体释放更多时间用于推理、调用工具和检查答案,同时保持接近自然人类对话的交互节奏。
自研模型矩阵持续扩张
此次发布延续了微软今年以来扩大MAI自研模型矩阵的动作。此前微软已推出MAI-Transcribe-2、MAI-Voice-2、MAI-Thinking-1、MAI-Code-1.1-Flash以及MAI-Image系列模型,并逐步接入Microsoft Foundry以及Copilot、Teams、GitHub、Dynamics 365等产品和服务。其中,MAI-Transcribe-2目前已覆盖会议记录、视频字幕、客服文档、无障碍服务以及语音智能体等场景;此次加入实时流式版本,意味着其自研模型的竞争重点正从单项识别准确率转向实时语音智能体的完整链路。
对微软而言,这一方向的意义不止于增加几个模型。随着AI智能体从文字交互走向电话客服、语音助手、实时翻译和多模态工作流,语音识别与语音生成的延迟、准确率和成本都会直接影响用户体验与企业部署成本。此次MAI-Transcribe-2-Streaming在Artificial Analysis测试中登顶,至少显示微软在语音AI这一细分赛道正在加速追赶并进入第一梯队。