崑崙萬維旗下Skywork團隊在7月19日世界人工智慧大會WAIC 2026期間,正式釋出了世界模型Matrix-Game 3.5。該模型能夠在單張GPU上以720P解析度、約20FPS的幀率即時生成可互動的世界,並根據使用者動作和事件指令持續輸出內容,同時保持場景結構、空間佈局、角色身份和動態內容的一致性。
世界模型是過去一年AI領域最受關注的方向之一。據行業統計,過去18個月內世界模型企業吸納了超過100億美元的投資。圖靈獎得主楊立昆(Yann LeCun)甚至預言,三到五年內世界模型將取代大語言模型成為主流AI範式。然而,當前多數世界模型產品仍停留在“生成影片”階段,面臨長期記憶能力薄弱、相機控制精度不足、即時互動能力有限等瓶頸,普遍缺乏對物理規則的理解。Matrix-Game 3.5正是在這一背景下推出。
Matrix-Game 3.5從三個層面實現了系統級加速。在模型吞吐最佳化方面,團隊通過蒸餾將取樣步數壓縮至3-step Sampling,並設計分塊因果推理(Chunked Causal Inference),結合KV Cache、Patch Latent等技術,在保持生成質量的同時提高單次推理吞吐。在DiT推理最佳化方面,團隊針對推理熱點進行了FFN INT8量化、Memory Retrieval Optimization等最佳化,降低DiT推理耗時。在VAE解碼最佳化方面,團隊使用MG-LightVAE對Wan2.2 VAE Decoder進行約75%結構化剪枝,大幅降低解碼延遲。
新版本在技術架構上有多項突破。其Patch Memory是業內首個幾何對齊的Patch級長期記憶機制。傳統做法是原樣儲存歷史幀,檢索時容易產生畫面衝突。3.5版本將歷史幀切分為三維座標系下的空間塊,按空間位置匹配重組,使相機重訪場景時能準確找回此前觀察過的空間內容。行業評測顯示,主流世界模型的“物體重現得分”沒有一個超過0.6,而Patch Memory顯著提升了這一指標。此外,模型採用動靜解耦記憶機制,讓Patch Memory負責靜態場景結構,主體參考Token負責維持動態主體的身份一致性。
在相機控制方面,3.5版本引入相機位姿相對編碼PRoPE機制,通過相機投影矩陣讓模型直接感知相機相對位姿,並將PRoPE與Warped RoPE組合,使位置編碼升級為具備幾何語義的世界表示。這一調整避免了傳統方法中動作控制訊號作為額外引數注入模型帶來的基礎能力破壞問題。
資料是訓練世界模型的核心瓶頸。網際網路影片資料包含大量反物理內容,而世界模型需要涵蓋推拉擰拽、柔性物體、摩擦力、流體等真實物理互動的資料。Skywork團隊構建了三條自動化資料生產管線:基於Unreal Engine 5的自主探索管線、覆蓋《GTA V》等主流3A遊戲的跨遊戲自動化控制與探索管線,以及開放平台影片自動挖掘管線。團隊還搭建了自動化離線標註系統,為每條影片估計相機位姿、米制深度和相機內參,並構建了基於多模態大模型的影片Prompt自動標註系統。
Matrix-Game系列從1.0到3.5經歷了不到兩年的四次迭代。2025年3月釋出的1.0版本是概念驗證;2.0版本在2025年8月實現單卡B100、720P下25FPS的即時互動,成為業界首個開源方案;3.0版本在2026年3月釋出,5B引數蒸餾模型實現720P下40FPS的即時生成。此次3.5版本的最大變化是從遊戲場景向真實場景全面擴充套件,支援多風格動態切換與指令控制,並引入NPC互動能力。
Matrix-Game始終堅持開源策略。此前,DiT作者、紐約大學助理教授謝賽寧團隊基於Matrix-Game 2.0的開源底座釋出了全球首個多人影片世界模型Solaris。輝達和浙大聯合釋出的工作Light Interaction基於Matrix-Game 3.0研發。此外,輝達的SANA-WM和Adobe的RELIC等國際頭部大廠的世界模型工作,均將Matrix-Game相關模型作為對比基準。
崑崙萬維董事長兼CEO方漢判斷2026年是“世界模型元年”。Matrix-Game 3.5是崑崙萬維“4+3”AGI戰略的核心組成部分,該戰略下影片模型SkyReels、音樂模型Mureka、世界模型Matrix-Game、基座文本與多模態模型構成四大技術底座,AI短劇、AI音樂、AI遊戲三大平台經濟體承載商業化落地。在WAIC 2026上,崑崙萬維集中完成了四大核心模型的全球首發。