螞蟻百靈(inclusionAI)在 Hugging Face 上釋出了 Realtime-Venus 全雙工互動系統,包含兩個 9B 引數檢查點,均以 Apache-2.0 許可開源。其中 Realtime-Venus-Omni 是音影片互動模型,能夠持續「看」和「聽」,自行判斷是否以及何時回應,並在共享的因果時間線上同時生成文本與語音;Realtime-Venus-Audio 則聚焦音訊理解與音訊驅動的對話,可輸出文本或語音。
該系統的核心能力圍繞「即時在場」展開。它支援原生全雙工對話,即在說話的同時保持感知,並能區分附和、打斷、糾正與話題轉向等不同互動訊號;具備主動互動能力,持續處理時間對齊的影片與音訊,在事件值得回應時主動發起響應,而無需等待使用者提示。此外,系統通過共享因果時間線發出流內委派請求,並以同樣方式消費非同步後端結果,使外部任務不會阻塞正在進行的對話——不過執行這些請求需要配套的 Realtime-Venus-Harness 執行時,該執行時託管在 GitHub 倉庫中。
長影片記憶方面,Realtime-Venus 採用免訓練方案:歸檔視覺資訊豐富的時刻,檢索與查詢相關且不冗餘的證據,並重新組裝對應的音影片上下文,無需額外訓練。語音輸出則通過捆綁的 Token2wav 資源與參考音色,在生成回應文本的同時合成原生語音。
從模型細節看,兩個檢查點均基於 MiniCPM-o 4.5 / Omni-Flow 架構,語言骨幹為 Qwen3-8B,音訊編碼器為 Whisper-Medium,權重精度為 BF16,上下文長度為 40,960 tokens。Omni 版本額外使用 SigLIP2 視覺編碼器(推理時不啟用),語音生成採用離散 S3 語音 token 配合流式流匹配解碼器;Audio 版本在推理時不使用視覺編碼器,但共享同一套流式骨幹與語音解碼器,並在全雙工模式下啟用。
倉庫結構上,兩個檢查點分別位於 Realtime-Venus-Omni/ 與 Realtime-Venus-Audio/ 子目錄,各自包含分片模型權重、配置與自定義 Transformers 程式碼。Omni 目錄還提供公開的記憶入口 realtime_venus_omni_memory.py、記憶介面卡目錄(含聊天與雙工記憶執行時)以及參考音色、Token2wav 和演示影片等資源。安裝需要 Python 3.10、CUDA 與 FFmpeg,可通過 huggingface-cli 或 modelscope 下載後安裝依賴。
使用層面,Omni 模型通過 as_duplex() 切換至全雙工流式模式,prepare() 初始化會話,之後每一秒輸入由一組 streaming_prefill() 與 streaming_generate() 處理,as_simplex() 可切回離線模式。需要注意的是,影片超過 64 秒會被截斷至預設幀上限,需在匯入 minicpmo.utils 前設定 MAX_NUM_FRAMES;雙工示例通過 FFmpeg/libass 將回應文本燒錄進輸出影片,渲染中文等非拉丁字元需要系統安裝 CJK 字型,否則會顯示為空框。
從產業視角看,Realtime-Venus 把「全雙工」與「主動互動」作為賣點,意味著多模態模型正從「使用者提問—模型回答」的回合制,轉向持續感知、可被打斷、能主動開口的即時系統。這類能力對即時翻譯、陪伴式助手、會議與直播場景、以及需要邊看邊說的機器人互動都有直接價值。非同步委派機制則試圖解決即時對話與外部工具呼叫之間的阻塞矛盾,讓模型在對話不中斷的前提下呼叫後端能力。免訓練長影片記憶若在實際使用中穩定,也有助於降低長上下文場景的部署成本。不過,全雙工與主動互動對延遲、算力與工程整合的要求較高,實際體驗仍取決於 Harness 執行時的成熟度與硬體條件。螞蟻百靈此次以開源方式放出兩個 9B 檢查點,為開發者在即時多模態方向提供了可復現的基線,後續生態對其記憶機制與委派能力的採用情況值得關注。