爱诗科技在 2026 年 1 月提出「通用实时世界模型」这一产品方向并推出 R1,目前 PixVerse R2 已全量上线,用户可直接进入网页端体验动作指令和互动影游的相关交互。这条路线试图回答一个更根本的问题:大语言模型已经用 Scaling 证明模型、数据和算力可以持续换来更强能力,必须一边生成、一边回应用户的实时世界模型,能不能也走上同一条路?
过去几年,Scaling 最具确定性的成功故事来自大语言模型。随着模型容量、训练数据和计算规模持续扩大,语言模型获得了更强的理解、推理与泛化能力,「越大越强」由此成为大模型产业最重要的认知基础之一。但把这条经验迁移到世界模型,问题复杂得多。语言模型可以在接收问题后集中计算再给出答案,实时世界模型却必须一边运行,一边接收用户的动作、文字和声音,同时继续输出连贯的音视频内容。这形成一组长期矛盾:实时要求模型足够快、足够高效,通用则要求模型足够强、见过足够丰富的世界。能力向上扩展,计算负担随之增加;为速度持续压缩能力,实时体验又容易停留在只能完成有限演示的专项模型。
PixVerse R2 给出的答案,是把能力与效率拆成两层推进。按照官方定义,R2 的 Scaling 同时发生在模型容量、数据、任务、控制信号和时间尺度五个维度上,最终转化为用户可感知的三类结果:更高的生成质量、更强的长程一致性,以及更丰富的多模态控制。
在产品端,R2 实时生成的世界「冬日宫殿」让用户面对一个仍在运行的环境。WASD 和方向键用于控制移动与视角,新指令可以继续改变当前体验;每次操作之后,页面不会退回独立的生成流程,用户仍留在同一个世界里。技术报告中的 Scaling 最终要回到产品端接受检验:它能否让用户真正进入一个世界,而不是在一段视频上叠加几个控制按钮?
对冬日宫殿会话的 HAR 网络记录分析显示,本轮会话中客户端全程只观察到一次 session_init 和一次 generation_started。此后八轮系统推荐 Prompt 共享同一条内容流,提示历史从第一轮连续累积到第八轮,客户端没有为每一轮输入重新预约资源、初始化会话或切换媒体通道。约 119.5 秒的生成窗口里,所有操作都被组织在同一条持续 session 中。这意味着,从用户可见的产品流程看,八轮 Prompt 并不是八个彼此独立的视频任务拼凑起来的,而是当前世界下一步如何变化的连续控制输入。一次生成不再以交付文件为终点,还要成为后续行动不断发生的环境。
同一会话中,HAR 还记录到 3,355 条结构化 action_frame,发送间隔中位数约 29.944 毫秒,折算频率约 33.4Hz。用户按住 W、组合方向或调整镜头时,客户端持续发送的是一条高频、低层控制流,而不是把「向前走」转写成一句偶尔触发的文字命令。传统 AI 视频中的 Prompt 决定内容大致长成什么样,而在持续世界里,Action 决定用户此刻正在做什么。当 Prompt 和 Action 能够进入同一个运行过程,用户与模型的关系才会从提出要求、等待结果,进一步变成进入环境、持续行动。
语言与动作也不需要轮流占用这个世界。每轮 Prompt 从发送到 prompt_generated 大约经历 3.9 至 4.5 秒;在第三至第八轮中,Prompt 发出后约 8 至 26 毫秒,Action 就继续进入控制通道,每个对应窗口内又持续发送了约 129 至 152 条动作帧。也就是说,处理语义指令时,WASD 通道仍然保持开放,两类输入可以同时进入一条运行中的世界会话。延迟数据进一步说明这条实时链路怎样工作:八轮推荐 Prompt 发出后,服务端 prompt_updated 的中位耗时约 1.33 秒,与爱诗所说的「约 1—2 秒响应」处在相同区间;完整 prompt_generated 事件的中位耗时约 4.27 秒。前者代表当前世界流中的指令状态已经更新,并不等同于用户恰好在 1.33 秒看见完整目标变化,但它说明从接收、审核到世界流更新,R2 已经建立起一套秒级 Prompt 协议链路。
冬日宫殿也展示了 R2 当前对外开放的产品形态。初始化消息显示,它由一张首帧和 345 个字符的 world setting 启动,同时配置了风格、音乐和 Action 等基础信息,并未设置 preset_video_uri。从客户端可见流程看,页面没有播放一段预置底片,而是通过 pipeline=r2 返回持续生成的实时媒体。
如果说冬日宫殿展示的是「世界怎样持续回应用户」,那么互动影游 Zero Mark 展示的则是这套能力「如何进入一段更长、更有结构的内容产品」。两者在界面上已呈现明确分工:World 直接提供 WASD、镜头和 Prompt,强调自由移动与即时变化;Story 则以结构化剧情选择和电影化演出组织长叙事,同时保留文本入口,为固定分支之外的变化预留空间。HAR 进一步确认,两者采用了不同的产品 pipeline:Winter Palace 运行在 r2 pipeline 中,Zero Mark 则使用 director pipeline。后者维持了一条约 20 分钟的长 session:53 次有效状态响应始终指向同一脱敏 session,状态保持为 ACTIVE,媒体通道也没有改变。同一长会话中还出现了多次媒体轨道分段切换,与 Director 的段落化编排形态相吻合;页面记录则确认了多次结构化剧情选择,以及一次文本入口点击。本轮网络记录中,同一会话里同时出现了结构化选择、实时媒体,以及八段预先准备的 1080p、24fps 关键电影资产。它们共同守住关键叙事节点的节奏与电影完成度,并为世界模型提供的开放变化留下入口。
技术解法上,PixVerse R2 把能力与效率拆到两个层次分别推进:Omni Causal AR 负责持续抬高世界模型的能力上限,Real-Time Acceleration 再把上游能力带回低延迟、可交互的运行区间。Omni Causal AR 是能力引擎,目标是把文字、参考图、声音和 Action 纳入统一的因果世界模型。它用 Dynamic Chunk 适配不同控制信号的时间粒度,通过分层的历史与对象状态机制维持长期锚点、近期动态和关键对象,再借助 Error Bank 等设计,让模型学习如何从已经发生的偏差中继续运行。Real-Time Acceleration 则是加速引擎:R2 不让一个新的少步模型从头学习整个世界,而是从同一个 Omni Causal AR 基础初始化 Student 与蒸馏 Teacher,再通过同源蒸馏、稀疏计算和金字塔式少步生成,将上游已经获得的生成、控制和长程能力尽可能完整地带回实时区间。按照官方公开口径,这套系统还试图把世界模型压缩到消费级单卡可以实时运行的范围,使更强的基础模型不必天然意味着更远离用户的离线演示。
爱诗走到 R2,首先源于对问题的不同定义。它没有去持续追问怎样再生成一段更长的视频,而是去思考怎样让生成内容成为一个用户可以进入、可以行动、还愿意继续停留的世界。R1 先把生成视频转变为持续交互过程,R2 再把扩大能力上限与压入实时运行拆成两个层次,这条演进路线从一开始就同时包含模型问题与产品问题。按照官方口径,PixVerse 已拥有全球 1.5 亿用户,并从 2026 年 1 月起向普通用户开放世界模型体验。C 端实时服务会把延迟、并发和单位算力成本直接变成产品约束,因此 Real-Time Acceleration 不是基础模型完成后的附加优化,而是整条路线本身的一部分。
从行业视角看,世界模型正在沿几条不同路线快速抬高能力边界。Google DeepMind 的 Genie 3 强调高分辨率、数分钟一致性与 Agent 训练;Decart Oasis 3 把低延迟、多视角和 Physical AI 部署作为重点;World Labs Marble 选择先生成可持久、可编辑和可导出的显式 3D 世界;HappyOyster、Odyssey 等路线,则分别向实时漫游、导演模式和通用交互视频推进。它们分别代表能力、部署效率、显式空间和产品形态的不同方向。如果用能力与通用性作为横轴,用实时交互效率与产品可运行性作为纵轴,传统方案往往需要在一条曲线上选择位置:更强的模型可能运行得更慢,更快的模型又可能只覆盖少量任务。R2 通过 Omni Causal AR 与 Real-Time Acceleration,让能力和效率拥有可以分别推进的结构;它希望做到的,不只是在现有曲线上找到一个更好的静态坐标,而是让整条曲线具备继续向右上移动的可能。
当内容从文件变成 session,生成式娱乐的产品单位也在发生变化。AI 视频与实时世界模型最根本的差别,或许不在于多了几个控制键,而在于用户进入的不再是一段等待播放的成品,而是一个持续运行、持续响应、可以不断被改变的环境。这条路径能否真正兑现「越大越强」的承诺,仍要看它在真实用户规模下的延迟、成本与内容质量表现。