Meta的Superintelligence Labs于9月6日发布了其首个实时音频感知模型Muse Voice Transcribe。该模型能在对话过程中实时转录语音、区分说话人并检测句子边界,被视为构建“永不停止倾听”的AI助手的基础组件。模型将输入音频切分为80毫秒的片段,每处理完一个片段,模型会决定是继续聆听还是输出下一个词作为文本,从而在收集上下文与响应速度之间做出权衡。等待时间越长,转录越准确,但延迟也越高。Meta表示,模型会根据每个词的难度动态调整等待时间——简单词汇输出更快,困难词汇则给予更多聆听时间。这一行为通过强化学习训练,模型同时被奖励低错误率和短延迟。
Muse Voice Transcribe将说话人分离和句子检测功能集成在同一模型中,无需额外系统。对于说话人归属,模型在文本流中标记说话人变化,并用A到Z的标识符标注每个段落;对于句子边界,则标记每个话语的开始和结束。这两个任务与语音识别联合训练。模型能同时区分超过20位说话人,并能处理超过一小时的录音而无需后处理。在Meta展示的演示中,八人房间内的对话,系统能实时将词语分配给各个说话人。
多语言支持是模型的一大卖点。Meta称Muse Voice Transcribe在超过70种语言上训练,其中25种经过深度测试。模型还支持语码转换,即说话人在句子中途切换两种语言。提供语言、关键词和上下文提示可进一步提升准确性,尤其对“Meta”、“Muse”或“Menlo Park”等专有名词。
独立评测机构Artificial Analysis在9月1日的测试中证实了Meta的说法。Muse Voice Transcribe在说话人结束讲话后0.16秒内,英语词错率为3.1%。相比之下,ElevenLabs Scribe v2 Realtime的词错率为3.6%(延迟0.14秒),AssemblyAI Universal-3.5 Pro Realtime为4.0%。Cartesia Ink-2则根据是否依赖外部系统检测话语结束,得分在3.4%或4.0%之间。竞争相当激烈,OpenAI已于5月发布用于相同目的的GPT-Realtime-Whisper,并在7月下调了转录模型价格。
Meta将此次发布与CEO马克·扎克伯格“个人超级智能”的愿景挂钩。在一场精心设计的演示中,Meta员工认为可靠的语音识别是个人AI代理的基础,这些代理可通过AI眼镜等设备实时聆听真实对话。值得注意的是,在德国,Meta的摄像头眼镜近期曾面临禁令讨论,不过德国联邦网络局最终决定不采取行动。
Muse Voice Transcribe现已为Meta AI和Muse Code中的语音听写提供支持,并通过Meta Model API开放。用户可在任何应用中按住“Fn”键进行体验。定价方面,Meta以每小时0.18美元(即每1000音频分钟3美元)的价格低于市场,Cartesia Ink-2为4美元,ElevenLabs Scribe v2 Realtime和Deepgram Flux均为6.5美元。这延续了Muse Spark 1.1和1.2的策略,即Meta以价格而非峰值性能竞争。公司未披露模型的参数数量、训练数据量或音频数据来源,也未开放权重。
Meta于2025年夏季重组其AI部门,成立Superintelligence Labs,并从OpenAI、Google DeepMind和Apple招募顶尖研究人员,提供高达四年3亿美元的薪酬方案。不过并非所有人都留下,部分人在几周后便返回了OpenAI。