Vivix 今日正式釋出其首個即時互動基礎模型 A1,定位為全球首款在一套原生流式架構中統一多模態參考、即時互動與流式生成的模型。該模型在單張消費級 GPU 上實現了超過 10000 video tokens/s 的推理吞吐,端到端互動延遲平均僅 0.6 秒,響應新輸入的最短時間可達 300 毫秒。官方已開放內測申請,開發者可通過官網及 API 平台體驗。
A1 的核心突破在於其原生流式架構。傳統 clip-based 影片模型一次生成一個完整片段,可以提前統籌前後動作與畫面;而流式生成需要一邊生成一邊接收使用者新指令,即時預測下一段內容,如同“一邊鋪鐵軌,一邊開火車”。A1 通過因果時序建模和流式狀態維護,將圖片、影片、聲音、互動歷史和已生成內容共同寫入持續狀態,在長時間範圍內維持角色身份、場景和物體關係的一致性,同時避免因怕出錯而讓角色靜止不動——這是它與現有數字人相關模型最大的區別。
在互動訊號建模上,A1 沒有將 ASR 文本作為唯一的互動中間表示,而是直接建模語言語義、聲學特徵、非語言聲音、環境事件、手勢和動態視覺訊號。多模態上下文(包括音影片參考、系統提示、歷史幀等)會原生多模態地輸入模型,模型在約 300 毫秒內推理出最新響應 token(“快思考”),而更上層的 Director Agent 則負責“慢思考”——推理、規劃、工具使用,並非同步給出長時序的宏觀行為控制。
為實現消費級 GPU 上的即時推理,Vivix 提出了多維聯合蒸餾(MJD),將影片擴散模型從 8-Step 質量基線壓縮到 2-Step 推理,同時保持接近 8-Step 版本的短時畫質、指令遵循、運動表現和長時穩定性。MJD 讓學生模型學習教師模型更完整的動作分佈,並在 latent 潛空間和原始資料空間中進行最佳化,防止模型通過少動換取穩定。
在推理基礎設施層面,Vivix 推出了 VMI(Vivix Model Infra),核心思路是解耦任務、降低精度、統一排程。具體包括:將多模態 Encoder 與即時 Decoder Loop 分離,避免批次任務堵塞即時鏈路;引入 prefill/decode 分離並重新設計 KV Cache 傳輸層;採用原生 NVFP4 訓推策略,在訓練和蒸餾階段就讓模型適應 4-bit 數值分佈,而非訓練完成後直接做 PTQ,同時加入去噪誤差校正以抑制量化誤差累積;構建計算-通訊-記憶體協同排程引擎,將 Attention 通訊、視訊記憶體 Offload 和跨服務資料傳輸執行在不同 CUDA Stream 中,儘可能與 GPU 計算重疊,並利用 CUDA Graphs 將數百次 Kernel Launch 壓縮成少量統一提交。
實測顯示,VMI 實現單卡吞吐超過 10000 video tokens/s,在多卡鏈路中 PCIe 頻寬利用率達到 88%+。整套鏈路支援穩定連續生成、模型級打斷和即時重定向,Encoder 與 Decoder 可獨立彈性伸縮。
A1 的釋出標誌著即時多模態生成從概念驗證走向可部署的產品。它讓螢幕中的角色真正擁有了身體——能夠行動、轉身、改變姿態,並與所在世界裡的物體和環境持續互動。使用者不再只是站在螢幕外看故事,而是可以隨時介入,改變人物的選擇、行動和劇情走向。Vivix 表示,A1 交付的不再只是一個即時互動的概念,而是一套已經執行起來的原生流式多模態模型。