Meta的Superintelligence Labs於9月6日釋出了其首個即時音訊感知模型Muse Voice Transcribe。該模型能在對話過程中即時轉錄語音、區分說話人並檢測句子邊界,被視為構建“永不停止傾聽”的AI助手的基礎元件。模型將輸入音訊切分為80毫秒的片段,每處理完一個片段,模型會決定是繼續聆聽還是輸出下一個詞作為文本,從而在收集上下文與響應速度之間做出權衡。等待時間越長,轉錄越準確,但延遲也越高。Meta表示,模型會根據每個詞的難度動態調整等待時間——簡單詞彙輸出更快,困難詞彙則給予更多聆聽時間。這一行為通過強化學習訓練,模型同時被獎勵低錯誤率和短延遲。

Muse Voice Transcribe將說話人分離和句子檢測功能整合在同一模型中,無需額外系統。對於說話人歸屬,模型在文本流中標記說話人變化,並用A到Z的識別符號標註每個段落;對於句子邊界,則標記每個話語的開始和結束。這兩個任務與語音識別聯合訓練。模型能同時區分超過20位說話人,並能處理超過一小時的錄音而無需後處理。在Meta展示的演示中,八人房間內的對話,系統能即時將詞語分配給各個說話人。

多語言支援是模型的一大賣點。Meta稱Muse Voice Transcribe在超過70種語言上訓練,其中25種經過深度測試。模型還支援語碼轉換,即說話人在句子中途切換兩種語言。提供語言、關鍵詞和上下文提示可進一步提升準確性,尤其對“Meta”、“Muse”或“Menlo Park”等專有名詞。

獨立評測機構Artificial Analysis在9月1日的測試中證實了Meta的說法。Muse Voice Transcribe在說話人結束講話後0.16秒內,英語詞錯率為3.1%。相比之下,ElevenLabs Scribe v2 Realtime的詞錯率為3.6%(延遲0.14秒),AssemblyAI Universal-3.5 Pro Realtime為4.0%。Cartesia Ink-2則根據是否依賴外部系統檢測話語結束,得分在3.4%或4.0%之間。競爭相當激烈,OpenAI已於5月釋出用於相同目的的GPT-Realtime-Whisper,並在7月下調了轉錄模型價格。

Meta將此次釋出與CEO馬克·扎克伯格“個人超級智慧”的願景掛鉤。在一場精心設計的演示中,Meta員工認為可靠的語音識別是個人AI代理的基礎,這些代理可通過AI眼鏡等裝置即時聆聽真實對話。值得注意的是,在德國,Meta的攝像頭眼鏡近期曾面臨禁令討論,不過德國聯邦網路局最終決定不採取行動。

Muse Voice Transcribe現已為Meta AI和Muse Code中的語音聽寫提供支援,並通過Meta Model API開放。使用者可在任何應用中按住“Fn”鍵進行體驗。定價方面,Meta以每小時0.18美元(即每1000音訊分鐘3美元)的價格低於市場,Cartesia Ink-2為4美元,ElevenLabs Scribe v2 Realtime和Deepgram Flux均為6.5美元。這延續了Muse Spark 1.1和1.2的策略,即Meta以價格而非峰值效能競爭。公司未披露模型的引數數量、訓練資料量或音訊資料來源,也未開放權重。

Meta於2025年夏季重組其AI部門,成立Superintelligence Labs,並從OpenAI、Google DeepMind和Apple招募頂尖研究人員,提供高達四年3億美元的薪酬方案。不過並非所有人都留下,部分人在幾周後便返回了OpenAI。