由 AI 先驱李飞飞创立的 World Labs 于 8 月 15 日发布了一款名为“Real-to-Sim-to-Real”(R2S2R)的仿真引擎,该引擎能在完全虚拟的环境中训练机器人控制系统,并将单个真实世界任务转化为数千种受控变体,从而大幅减少对昂贵硬件测试的依赖。据公司介绍,训练后的模型在五种不同机器人平台上各运行了一小时,期间无需任何人工干预。
World Labs 表示,机器人部署的主要瓶颈并非模型架构,而是机器人需要大量经验才能可靠运行。真实世界的数据成本高昂且难以控制,即使是网络视频也无法系统覆盖所有物体、物理条件和失败状态。R2S2R 引擎通过结合生成式世界模型与任务导向的机器人仿真,将机器人、传感器、环境和任务演示重建为一个交互式虚拟世界,该世界不仅外观与原始环境相似,物理行为也保持一致。
从单个真实任务出发,系统通过改变光照、物体位置和数量、周围环境、摩擦等物理属性以及相机角度,生成数千种变体。为验证准确性,World Labs 会在仿真和现实中并行运行相同的动作序列,并比较观察结果、物体运动和最终结果。示例任务包括电缆布线、将弹性电缆末端插入孔中以及双手装箱等,涉及刚性、可移动和可变形物体。
控制模型完全在仿真中训练,然后迁移到真实机器人上。测试平台之一是 ALOHA,这是斯坦福大学开源的双臂设计,通过两个较小的控制臂进行操控。该设备成本仅为商用系统的一小部分,且所有蓝图公开,使其成为机器人研究领域的参考平台。据 World Labs 称,模型在另外四个机器人平台上各运行一小时,任务包括双手将电源线缠绕在冰箱上、精确重新定位试管以及从密集堆中分离细长物体(如记号笔或铅笔)等。
该系统不依赖于特定控制模型或机器人类型,因此重建一次的世界可重复用于新模型和不同机器人。World Labs 认为,机器人开发之所以落后于语言模型,很大程度上是因为评估控制模型主要依赖真实硬件测试。一个可靠的仿真不需要达到与真实环境相同的成功率,关键在于能否回答同样的问题:模型在哪里失败、哪个版本更好、改进是否能迁移到物理机器人上。
团队用 ALOHA 机器人的双臂进行立方体交接测试,仿真成功复现了机器人勉强抓住立方体边缘的临界情况以及匹配的失败尝试。在不同模型类型(包括 GR00T N1.6 和 π₀.₅)和训练阶段中,仿真与现实的模型排名基本保持一致,无论立方体位置是否已知。每个检查点使用 2,000 次仿真和 100 次真实运行进行评估。开发团队可以在仿真中筛选出较弱的模型版本,将昂贵的硬件测试留给最有潜力的候选者。
该仿真器是 World Labs 更广泛战略的核心部分。公司将其与世界模型分类法联系起来,认为仿真器是将世界转变为软件代理可以行动、学习和测试的场所的关键。World Labs 还类比自动驾驶领域,指出一些成功的 L3 和 L4 系统混合使用真实和仿真数据进行训练。公司的长期目标是通过扩展机器人学习的世界来扩展机器人的智能。
然而,这些结果能否迁移到更复杂的环境、其他机器人类型以及更不受控制的日常场景,仍是一个开放问题。World Labs 成立于 2024 年,由李飞飞创立,旨在构建理解三维物理世界的空间智能模型。早期系统可从单张照片生成可步行的 3D 环境。近期,公司筹集了 10 亿美元风险投资,将世界模型扩展到机器人和科学领域。R2S2R 引擎是该愿景在机器人领域的首个具体应用。
这项研究也引发了关于世界模型在机器人中作用的更广泛讨论。一个国际研究团队最近试图定义世界模型的统一标准,将其与纯视频生成器明确区分。相关领域还包括“世界动作模型”,它将近期预测直接与控制命令绑定,这与 World Labs 将仿真和策略分离的方法不同。另一种名为 Orca 的方法来自中国,允许机器人仅通过观看视频学习任务,无需真实运动数据。