具身智能领域权威评测WorldArena 2.0 Track 1近日公布最新成绩,昆仑行机器人研发的昆仑世界模型GeWu以69.58分斩获图像质量(Image Quality)单项冠军,并以65.91的综合得分获得全球榜单亚军。该模型在物理一致性(Physics Adherence)可控性(Controllability)等多项关键能力维度上实现大幅领先,是本次77支参赛模型中唯一一个在6大评测维度中,获得其中4项前4名次的模型,展现出较强的综合能力。

WorldArena由国际顶尖高校及科研机构联合共建,是世界模型赛道的权威评测基准。WorldArena 2.0在1.0的基础上构建了更全面的基准,从模态、功能、平台三大关键维度扩展具身世界模型评估。本次评测的Track 1赛道聚焦具身智能模型的基础核心能力,重点考核模型“看得准、猜得对、画面真实合理”的核心素养,突出模型在物理因果上的合理性。该赛道吸引了全球几乎所有顶尖世界模型研发团队同台竞技,被誉为具身世界模型的“国际竞技场和权威试金石”。

昆仑世界模型是昆仑行机器人研发的第一代世界模型,初次亮相即取得全面领先。据昆仑行介绍,其架构设计遵循“物理因果”第一性原理,不按模态拆分,而是按因果图中的角色语义,将模型拆为三座参数独立的Transformer塔:Tower 1负责Intent(目的),以自回归方式编码语言指令和场景理解;Tower 2负责Intervention(干预),以flow matching范式建模动作序列;Tower 3负责Consequence(响应),同样基于flow matching生成未来视频帧。三座塔共享decoder基础结构,但每层拥有独立的投影矩阵、前馈网络和归一化参数。

这一架构的关键在于塔间的信息流控制。昆仑世界模型通过联合因果注意力机制(United Causal Attention),在三塔之间施加严格的单向可见性约束:Tower 2可以看到Tower 1但不能看到Tower 3;Tower 3可以同时看到Tower 1和Tower 2。这意味着“行动决策”可以参考“任务目的”,但不能偷看“尚未发生的视觉后果”;而“视频渲染”需要同时知道“要做什么”和“怎么做”,才能生成物理因果上合理的画面。

消融实验印证了这一设计的必要性:一旦切断其中任意一条注意力通路,模型便会迅速从“因果仿真”退化为“默写模式”——它不再依据具体动作推演物理后果,而是直接将任务描述映射到训练集中最相似的视频片段,产生违背物理规律的画面。这一退化在评估模型物理合理性的核心维度交互质量(Interaction Quality)上表现得尤为明显。昆仑世界模型在该维度上取得了82.40的高分,正是因果架构发挥作用的直接体现。

三塔架构还天然支持多任务的统一推理。借鉴UniDiffuser的思想,通过调整各塔的噪声参数,同一套架构和权重即可在世界模拟、策略推理、联合预测等多种模式之间灵活切换。当动作塔和视频塔同时处于生成状态时,昆仑世界模型采用异步调度策略,让动作塔的去噪进度始终领先于视频塔,确保视频生成看到的动作信息始终更干净、更可靠。

面对长时序视频生成的需求,昆仑行研发团队设计了Chunk-wise自回归方案:长视频被拆分为多个片段逐段生成,核心挑战在于后续片段的上下文缺失。为此,昆仑世界模型引入了仿生记忆采样策略——模仿人类记忆的衰减规律,近端帧高密度保留以维持运动连续性,远端帧稀疏采样以保留任务全局进度。配合绝对时序位置编码和帧率自适应放缩机制,模型在所有生成阶段都能准确感知物理时间位置,并灵活控制动作节奏。

昆仑行机器人的模型研发负责人郝志会博士表示,在研发过程中,团队反复验证了一个核心判断:世界模型的架构设计应当尊重物理世界的因果结构。“目的驱动行动,行动产生结果”这条因果链不仅是人类理解物理世界的基本框架,也应当成为模型架构的第一性原理。当归纳偏置对齐问题本质时,团队不仅看到了指标的提升,也看到了训练效率和泛化能力的同步改善。

昆仑世界模型是昆仑行沿这一技术方向迈出的第一步。接下来,研发团队将在更复杂的任务场景中持续验证和扩展模型能力,并将昆仑世界模型应用于行为规划和仿真强化,推动世界模型从视觉渲染器进化为真正的物理智能基座。

昆仑行(Kunlunx AI)致力于打造面向物理世界的通用AI机器人,坚持“本体+大脑”双轮驱动战略,构建通用AI机器人本体、数据、小脑、大脑、智能体五位一体的全栈核心技术自研体系。公司认为物理因果是具身智能的第一性原理,并以此为核心打造昆仑世界模型(KWM),推动物理AI从实验室走向真实场景的规模化应用。