一篇由李飞飞、Yilun Du 等十余位顶尖学者联合署名的论文《Masked Visual Actions for Unified World Modeling》近日在 arXiv 上公开,迅速引发关注。论文提出一种名为 MVA 的方法,通过将机器人动作转化为像素遮罩轨迹,让机器人直接利用现成的视频生成模型,而无需训练专属的机器人大模型。这一思路可能为具身智能领域带来范式转变。

论文的署名阵容堪称豪华,包括 ImageNet 缔造者、如今专注空间智能的李飞飞,斯坦福助理教授、物理推理方向代表人物吴佳俊,ControlNet 作者张吕民,斯坦福计算成像实验室负责人 Gordon Wetzstein,以及机器人基础模型核心推动者黄文龙等。更令外界意外的是,哈佛助理教授 Yilun Du 也参与其中。李飞飞与 Yilun Du 恰好是具身智能领域两条技术路线的代表人物:一个主张让 AI 直接在视觉画面中思考,另一个主张先将一切压缩为抽象数字再思考。两人学术交集极少,上次合作还是五年前 Yilun Du 在 MIT 读博期间,此后观点一直存在分歧。此次同署一篇论文,被解读为两条路线可能找到了某种共识。

论文的核心观点是,机器人或许根本不需要自己的专属大模型,甚至无需重训已有的视频生成模型,只需找到合适的接口,就能直接利用日趋成熟的视频生成模型。这一结论对当前产业界构成挑战,因为许多大厂和创业公司正投入巨资研发机器人大模型,不少创业公司仅凭一个基座模型就撑起数十亿估值。

过去,视频生成模型虽然具备物理直觉,但无法直接控制机器人,因为机器人操作需要关节角度、末端位移等低层动作表征,这与视频模型理解的像素流动、颜色变化语言完全不对应。此前的研究尝试过多种方案,如 UniPi 用文本引导视频生成规划,但文字指令模糊;Track2Act 用点轨迹预测,但稀疏的点难以描述连续动作;Ctrl-world 直接输入关节角度,却因换机械臂即失效而显得脆弱。这些方法的共同问题是强迫视频模型学习一门它不熟悉的外语。

MVA 的思路则相反,它用视频模型自己的语言——像素——来传达动作。具体分为三步:首先,用 Meta 的 SAM 工具将视频中的机器人和操作物体分割出来,得到随时间变化的区域,形成两条运动轨迹;其次,遮住其中一条轨迹,让模型预测被遮住的部分,从而同时实现世界模拟(给定机器动作推演世界变化)和动作生成(给定世界变化反推机器动作),且始终使用同一个模型、同一套参数;最后,不从头训练模型,而是用 LoRA 微调阿里的开源视频生成模型 Wan2.2(140 亿参数),仅用 15 小时数据即可让机器人实现 zero-shot 泛化,从单臂操作泛化到未见过的双臂机器人。

论文的实验结果颇具说服力。在衡量生成画面与真实画面差异的 LPIPS 指标上,MVA 达到 0.0945,而对比方法 Ctrl-World 为 0.362,差距近四倍。更关键的是,当测试时换上训练阶段从未见过的双臂机器人时,Ctrl-World 当场失灵,而 MVA 仍能输出靠谱的预测。论文还演示了三种应用:为现有策略打分、作为规划器、以及反推动作。

产业界人士对这篇论文的评价聚焦于其泛化能力。深圳韦特嘉机器人 CTO 李琳鑫指出,文章的核心不在于模型训得好,而在于泛化性的增强,解决了异构机械手的识别与迁移问题。他特别提到论文中关于 URDF 的细节:MVA 在生成动作时,先通过逆运动学(IK)解算出各关节的配合,而不是直接输出与特定本体绑定的低层动作表征。这使得指令可以通用,而执行方式各自适配。URDF 文件作为机器人的通用说明书,记录了关节数量、角度限制、连杆长度等信息,MVA 利用它既限制了视频生成模型的想象力,又实现了跨本体泛化。

李琳鑫还指出,具身智能领域今年的行业趋势是将“看”和“动”拆开:视觉部分用互联网海量视频训练,数据量远超机器人实机数据;动作部分用相对少的机器人数据加运动学计算补齐。MVA 正好卡在这个趋势的接口上。尽管李琳鑫团队走的是受 Yann LeCun 影响的隐空间世界模型路线,但他认为在 URDF 导入和 IK/FK 解算上,两条路线可以结合,思路甚至相通。

这篇论文的深层含义在于,具身智能的发展或许不在于把机器人专属模型越练越大,而在于想办法直接借用已经很强的视觉大模型。互联网视频数据近乎无穷,而机器人真机操作数据稀缺且昂贵,谁能让机器人有效利用前者,谁就握有更大的筹码。当学术界的顶尖力量与产业界的架构变化不约而同指向同一方向,这条路径值得密切关注。