蚂蚁百灵(inclusionAI)在 Hugging Face 上发布了 Realtime-Venus 全双工交互系统,包含两个 9B 参数检查点,均以 Apache-2.0 许可开源。其中 Realtime-Venus-Omni 是音视频交互模型,能够持续「看」和「听」,自行判断是否以及何时回应,并在共享的因果时间线上同时生成文本与语音;Realtime-Venus-Audio 则聚焦音频理解与音频驱动的对话,可输出文本或语音。
该系统的核心能力围绕「实时在场」展开。它支持原生全双工对话,即在说话的同时保持感知,并能区分附和、打断、纠正与话题转向等不同交互信号;具备主动交互能力,持续处理时间对齐的视频与音频,在事件值得回应时主动发起响应,而无需等待用户提示。此外,系统通过共享因果时间线发出流内委派请求,并以同样方式消费异步后端结果,使外部任务不会阻塞正在进行的对话——不过执行这些请求需要配套的 Realtime-Venus-Harness 运行时,该运行时托管在 GitHub 仓库中。
长视频记忆方面,Realtime-Venus 采用免训练方案:归档视觉信息丰富的时刻,检索与查询相关且不冗余的证据,并重新组装对应的音视频上下文,无需额外训练。语音输出则通过捆绑的 Token2wav 资源与参考音色,在生成回应文本的同时合成原生语音。
从模型细节看,两个检查点均基于 MiniCPM-o 4.5 / Omni-Flow 架构,语言骨干为 Qwen3-8B,音频编码器为 Whisper-Medium,权重精度为 BF16,上下文长度为 40,960 tokens。Omni 版本额外使用 SigLIP2 视觉编码器(推理时不启用),语音生成采用离散 S3 语音 token 配合流式流匹配解码器;Audio 版本在推理时不使用视觉编码器,但共享同一套流式骨干与语音解码器,并在全双工模式下启用。
仓库结构上,两个检查点分别位于 Realtime-Venus-Omni/ 与 Realtime-Venus-Audio/ 子目录,各自包含分片模型权重、配置与自定义 Transformers 代码。Omni 目录还提供公开的记忆入口 realtime_venus_omni_memory.py、记忆适配器目录(含聊天与双工记忆运行时)以及参考音色、Token2wav 和演示视频等资源。安装需要 Python 3.10、CUDA 与 FFmpeg,可通过 huggingface-cli 或 modelscope 下载后安装依赖。
使用层面,Omni 模型通过 as_duplex() 切换至全双工流式模式,prepare() 初始化会话,之后每一秒输入由一组 streaming_prefill() 与 streaming_generate() 处理,as_simplex() 可切回离线模式。需要注意的是,视频超过 64 秒会被截断至默认帧上限,需在导入 minicpmo.utils 前设置 MAX_NUM_FRAMES;双工示例通过 FFmpeg/libass 将回应文本烧录进输出视频,渲染中文等非拉丁字符需要系统安装 CJK 字体,否则会显示为空框。
从产业视角看,Realtime-Venus 把「全双工」与「主动交互」作为卖点,意味着多模态模型正从「用户提问—模型回答」的回合制,转向持续感知、可被打断、能主动开口的实时系统。这类能力对实时翻译、陪伴式助手、会议与直播场景、以及需要边看边说的机器人交互都有直接价值。异步委派机制则试图解决实时对话与外部工具调用之间的阻塞矛盾,让模型在对话不中断的前提下调用后端能力。免训练长视频记忆若在实际使用中稳定,也有助于降低长上下文场景的部署成本。不过,全双工与主动交互对延迟、算力与工程集成的要求较高,实际体验仍取决于 Harness 运行时的成熟度与硬件条件。蚂蚁百灵此次以开源方式放出两个 9B 检查点,为开发者在实时多模态方向提供了可复现的基线,后续生态对其记忆机制与委派能力的采用情况值得关注。