昆仑万维旗下Skywork团队在7月19日世界人工智能大会WAIC 2026期间,正式发布了世界模型Matrix-Game 3.5。该模型能够在单张GPU上以720P分辨率、约20FPS的帧率实时生成可交互的世界,并根据用户动作和事件指令持续输出内容,同时保持场景结构、空间布局、角色身份和动态内容的一致性。
世界模型是过去一年AI领域最受关注的方向之一。据行业统计,过去18个月内世界模型企业吸纳了超过100亿美元的投资。图灵奖得主杨立昆(Yann LeCun)甚至预言,三到五年内世界模型将取代大语言模型成为主流AI范式。然而,当前多数世界模型产品仍停留在“生成视频”阶段,面临长期记忆能力薄弱、相机控制精度不足、实时交互能力有限等瓶颈,普遍缺乏对物理规则的理解。Matrix-Game 3.5正是在这一背景下推出。
Matrix-Game 3.5从三个层面实现了系统级加速。在模型吞吐优化方面,团队通过蒸馏将采样步数压缩至3-step Sampling,并设计分块因果推理(Chunked Causal Inference),结合KV Cache、Patch Latent等技术,在保持生成质量的同时提高单次推理吞吐。在DiT推理优化方面,团队针对推理热点进行了FFN INT8量化、Memory Retrieval Optimization等优化,降低DiT推理耗时。在VAE解码优化方面,团队使用MG-LightVAE对Wan2.2 VAE Decoder进行约75%结构化剪枝,大幅降低解码延迟。
新版本在技术架构上有多项突破。其Patch Memory是业内首个几何对齐的Patch级长期记忆机制。传统做法是原样存储历史帧,检索时容易产生画面冲突。3.5版本将历史帧切分为三维坐标系下的空间块,按空间位置匹配重组,使相机重访场景时能准确找回此前观察过的空间内容。行业评测显示,主流世界模型的“物体重现得分”没有一个超过0.6,而Patch Memory显著提升了这一指标。此外,模型采用动静解耦记忆机制,让Patch Memory负责静态场景结构,主体参考Token负责维持动态主体的身份一致性。
在相机控制方面,3.5版本引入相机位姿相对编码PRoPE机制,通过相机投影矩阵让模型直接感知相机相对位姿,并将PRoPE与Warped RoPE组合,使位置编码升级为具备几何语义的世界表示。这一调整避免了传统方法中动作控制信号作为额外参数注入模型带来的基础能力破坏问题。
数据是训练世界模型的核心瓶颈。互联网视频数据包含大量反物理内容,而世界模型需要涵盖推拉拧拽、柔性物体、摩擦力、流体等真实物理交互的数据。Skywork团队构建了三条自动化数据生产管线:基于Unreal Engine 5的自主探索管线、覆盖《GTA V》等主流3A游戏的跨游戏自动化控制与探索管线,以及开放平台视频自动挖掘管线。团队还搭建了自动化离线标注系统,为每条视频估计相机位姿、米制深度和相机内参,并构建了基于多模态大模型的视频Prompt自动标注系统。
Matrix-Game系列从1.0到3.5经历了不到两年的四次迭代。2025年3月发布的1.0版本是概念验证;2.0版本在2025年8月实现单卡B100、720P下25FPS的实时交互,成为业界首个开源方案;3.0版本在2026年3月发布,5B参数蒸馏模型实现720P下40FPS的实时生成。此次3.5版本的最大变化是从游戏场景向真实场景全面扩展,支持多风格动态切换与指令控制,并引入NPC交互能力。
Matrix-Game始终坚持开源策略。此前,DiT作者、纽约大学助理教授谢赛宁团队基于Matrix-Game 2.0的开源底座发布了全球首个多人视频世界模型Solaris。英伟达和浙大联合发布的工作Light Interaction基于Matrix-Game 3.0研发。此外,英伟达的SANA-WM和Adobe的RELIC等国际头部大厂的世界模型工作,均将Matrix-Game相关模型作为对比基准。
昆仑万维董事长兼CEO方汉判断2026年是“世界模型元年”。Matrix-Game 3.5是昆仑万维“4+3”AGI战略的核心组成部分,该战略下视频模型SkyReels、音乐模型Mureka、世界模型Matrix-Game、基座文本与多模态模型构成四大技术底座,AI短剧、AI音乐、AI游戏三大平台经济体承载商业化落地。在WAIC 2026上,昆仑万维集中完成了四大核心模型的全球首发。