Vivix 今日正式发布其首个实时互动基础模型 A1,定位为全球首款在一套原生流式架构中统一多模态参考、实时交互与流式生成的模型。该模型在单张消费级 GPU 上实现了超过 10000 video tokens/s 的推理吞吐,端到端交互延迟平均仅 0.6 秒,响应新输入的最短时间可达 300 毫秒。官方已开放内测申请,开发者可通过官网及 API 平台体验。

A1 的核心突破在于其原生流式架构。传统 clip-based 视频模型一次生成一个完整片段,可以提前统筹前后动作与画面;而流式生成需要一边生成一边接收用户新指令,实时预测下一段内容,如同“一边铺铁轨,一边开火车”。A1 通过因果时序建模流式状态维护,将图片、视频、声音、交互历史和已生成内容共同写入持续状态,在长时间范围内维持角色身份、场景和物体关系的一致性,同时避免因怕出错而让角色静止不动——这是它与现有数字人相关模型最大的区别。

在交互信号建模上,A1 没有将 ASR 文本作为唯一的交互中间表示,而是直接建模语言语义、声学特征、非语言声音、环境事件、手势和动态视觉信号。多模态上下文(包括音视频参考、系统提示、历史帧等)会原生多模态地输入模型,模型在约 300 毫秒内推理出最新响应 token(“快思考”),而更上层的 Director Agent 则负责“慢思考”——推理、规划、工具使用,并异步给出长时序的宏观行为控制。

为实现消费级 GPU 上的实时推理,Vivix 提出了多维联合蒸馏(MJD),将视频扩散模型从 8-Step 质量基线压缩到 2-Step 推理,同时保持接近 8-Step 版本的短时画质、指令遵循、运动表现和长时稳定性。MJD 让学生模型学习教师模型更完整的动作分布,并在 latent 潜空间和原始数据空间中进行优化,防止模型通过少动换取稳定。

在推理基础设施层面,Vivix 推出了 VMI(Vivix Model Infra),核心思路是解耦任务、降低精度、统一调度。具体包括:将多模态 Encoder 与实时 Decoder Loop 分离,避免批量任务堵塞实时链路;引入 prefill/decode 分离并重新设计 KV Cache 传输层;采用原生 NVFP4 训推策略,在训练和蒸馏阶段就让模型适应 4-bit 数值分布,而非训练完成后直接做 PTQ,同时加入去噪误差校正以抑制量化误差累积;构建计算-通信-内存协同调度引擎,将 Attention 通信、显存 Offload 和跨服务数据传输运行在不同 CUDA Stream 中,尽可能与 GPU 计算重叠,并利用 CUDA Graphs 将数百次 Kernel Launch 压缩成少量统一提交。

实测显示,VMI 实现单卡吞吐超过 10000 video tokens/s,在多卡链路中 PCIe 带宽利用率达到 88%+。整套链路支持稳定连续生成、模型级打断和实时重定向,Encoder 与 Decoder 可独立弹性伸缩。

A1 的发布标志着实时多模态生成从概念验证走向可部署的产品。它让屏幕中的角色真正拥有了身体——能够行动、转身、改变姿态,并与所在世界里的物体和环境持续互动。用户不再只是站在屏幕外看故事,而是可以随时介入,改变人物的选择、行动和剧情走向。Vivix 表示,A1 交付的不再只是一个实时交互的概念,而是一套已经运行起来的原生流式多模态模型。