爱诗科技(AIsphere)最新发布的实时世界模型 PixVerse R2 在海外引发关注:9 月 22 日上线当天,它登上 X(Twitter)趋势榜第二。与常见的视频生成产品不同,用户进入 PixVerse R2 创造的世界后可以移动、说话、做出选择,输入的每一个提示词和每一个动作都会实时改变眼前场景,甚至让剧情走向不同方向。有海外网友认为,这标志着 AI 生成从「创作视频」转向「与 AI 世界互动」,也有人形容体验不像看视频,更像身临其境。

要理解 R2 的意义,需要回看爱诗科技过去一年的产品线。今年 1 月,该公司发布 PixVerse R1 通用实时世界模型,首次让用户进入 AI 实时生成的世界:与传统视频生成一次性输出固定内容不同,用户可以在生成过程中持续输入指令、改变行动,模型随之更新场景。R1 证明实时、连续、可交互的音视频生成可以成立;R2 则进一步处理这个实时生成的世界,让用户在其中移动、探索,并通过不同行为改变环境与后续发展。此后半年,爱诗科技沿实时、交互、世界演化这条线扩展,陆续加入个性化 Avatar、Shared Worlds 与多人共同输入,并通过 PixVerse Game Engine 把实时世界模型与 Agent、游戏机制连接起来。8 月 23 日,公司发布 PixVerse R2 技术报告,披露其技术路线。

从实机体验看,R2 的交互大致分为三层。最基础的是 WASD 控制角色,体现实时响应:在草原越野场景中,用户可以开车加速、转向、爬坡,还能随时给世界「加东西」,比如召唤雄鹰、指定彩虹位置,甚至把车点燃,操作与世界变化基本连续发生,无需退出场景重新生成。第二层是自然语言改变世界,体现指令理解与动态生成:在逃离战区场景中,人物可自由移动,输入指令后能做出庆祝动作、召唤闪电;在《草原奥德赛》中,输入提示词后角色可以长出翅膀飞起,也能打开降落伞。第三层是进入互动影游,考验 AI 能否把交互、剧情、音效与世界状态串在一起:在《零印法师》中,用户面对前期 Boss 时直接输入「变小狗」,主角随即释放魔法把 Boss 变成金毛。玩家不再只能从开发者预设的技能和选项中挑选,而是可以用自然语言向世界提出要求。

这些体验背后,是实时世界模型必须解决的一组难题。当用户持续介入一个 AI 生成的世界,模型要做的就不只是生成速度,还要看懂用户在做什么、记住已经发生的事情、维持画面与空间关系的一致性,并及时响应下一步动作。对应到技术报告,PixVerse R2 提出四个核心能力:长程一致性、多模态控制、因果响应和状态保持。这些要求彼此并不独立——模型理解越深、需要保持的状态越多、生成时间跨度越长,背后的信息与计算量就越大,而实时交互又要求模型在下一秒给出结果,没有时间慢慢「算完」。由此引出一个关键问题:实时世界模型能否像大模型一样,找到一条持续 Scaling 的路径?

PixVerse R2 给出的思路,是把「模型能力」与「实时运行」拆开解决,再重新放进同一套训练和推理路径。一方面,Omni Causal AR 将文字、参考图像、音频、动作等不同信号统一纳入世界建模,让模型理解空间、时间与用户行为之间的关系;其中「Causal AR」让模型沿时间持续推进世界,当前状态成为下一步生成的依据。另一方面,Real-Time Acceleration 框架把推理加速等环节接入实时运行过程。一个值得注意的设计是,同一套 Omni Causal AR 既作为蒸馏 Teacher,也作为学生模型的初始化基础,让实时模型沿原有世界建模能力继续演化,而不是从头训练一个只追求速度的模型。两者衔接,形成「持续扩大能力上限,再稳定加速到实时运行」的演进路径。

更值得注意的是,R2 并未把 Scaling 简单理解为扩大规模,而是拆分为模型、数据、任务、控制信号、时间尺度五个维度:模型规模决定能力上限,数据和任务决定可覆盖的世界范围,控制信号决定用户介入世界的方式数量,时间尺度决定模型能否在更长时间里保持状态并持续演化。这条路径不只对应 R2 的一次升级,也是爱诗科技对实时世界模型如何持续扩展的技术回答。

从产业视角看,生成式 AI 过去解决的多是「给我一个结果」——输入提示词,得到一篇文章、一段代码、一张图片或一条视频,交付完成即结束。当模型能够理解用户行为、并依据已发生的状态继续生成,AI 交付的就不再是一段固定内容,而是一个可以被进入、被操控、不断变化的世界。除游戏之外,互动影视、虚拟角色、教育培训、工业仿真等场景同样存在大量需要根据用户行为实时变化的内容;过去这些变化需要提前设计和制作,未来其中一部分可能在用户真正进入之后才发生。PixVerse R2 所探索的,正是从「生成内容」到「生成世界」的这一演变过程,而它能否在保持实时性的同时持续提升能力,将决定这类产品能走多远。