7月22日,World Labs宣布正式收购顶级机器人仿真初创公司SceniX。两大顶尖研发团队联手,标志着具身智能的技术竞争正从纯语言模型全面走向物理世界模型。顶级风投a16z合伙人Martin Casado第一时间与World Labs联合创始人、首席执行官李飞飞及SceniX联合创始人李昀烛展开深度对话,系统拆解了世界模型、机器人基座模型、合成数据与评测体系等前沿议题。

李飞飞与李昀烛指出,人工智能的未来绝不能仅依赖缺乏物理约束的语言和文本理解,更要让机器具备感知、推理并与物理空间实时交互的空间智能。训练具身智能不仅需要一套与LLM截然不同的底层逻辑,更需要打破当前行业对纯视频预测模型和通用人形机器人的盲目崇拜。

空间智能是AI的下一个终局,而机器人是其物理落地的最佳载体。 AI的演进终将跨越单纯的文本交互,迈向具备感知、推理与空间交互能力的世界模型。在虚拟世界创作固然重要,但在现实物理空间中采取行动,才是空间智能最核心的落地场景。

解锁机器人Scaling Law的关键,是Real-to-Sim-to-Real数据闭环。 机器人领域无法像大语言模型那样直接从互联网获取海量物理数据。通过高精度数字建模与仿真,将真实环境映射到数字世界中生成无限数据,是破解数据饥荒、实现高效评估的关键。

纯视频模型缺乏物理与空间一致性,无法作为机器人的有效反馈信号。 许多流行视频模型生成的画面缺乏空间与时间一致性,甚至会出现物体凭空消失的幻觉。缺少了真实的物理约束与交互反馈,机器人根本无法学习正确的策略。

机器人基础模型将演变为以动作为输出的前向模拟器与策略模型。 未来的机器人基础底座将摒弃传统的文本框形式,演变为能够预测物理环境变化的前向模拟器,以及根据目标指令直接输出具体物理动作的策略模型。

仿真扮演着真实数据无法替代的关键角色:反事实推理与极限边界测试。 现实数据固然重要,但仿真能够让机器人在数字世界中无成本地演练极端、高危或现实中极少发生的场景,在大幅提升训练速度的同时,赋予系统更高的可靠性。

不应盲目追逐造硬件,而应优先构建模型与形态无关的基础设施。 具身智能生态的成功在于专业化分工。打造一套不挑底层算法、不挑硬件躯体(单臂/双臂/灵巧手)的通用仿真与评估平台,能让所有机器人大脑在其中加速进化。

相比通用人形机器人的执念,率先攻克半结构化场景的脏活累活才是理性选择。 机器人落地必然遵循从工厂流水线、到仓库餐厅等半结构化场景、最终才迈入家庭的物理规律。用定制化的硬件去解决特定的实际痛点,在商业和技术上远比强行推行昂贵的人形躯体更具可行性。

李飞飞介绍,World Labs是一家成立两年的前沿模型实验室,核心业务是构建大型世界模型,实现空间智能。收购SceniX的契机源于双方此前已建立的客户关系——SceniX曾注册成为World Labs生成式基础模型Marble的客户。Marble的核心能力是接收单张或多张图片或文本提示,将其转化为在几何上保持一致的3D世界。

李昀烛表示,SceniX的目标是帮助机器人更好地感知物理世界并与之交互,开发了Real-to-Sim-to-Real流水线,将真实环境精准映射到数字世界中,通过可扩展生成的数据替代真实环境中的训练和评估。两家公司技术互补:World Labs擅长生成式模型、计算机视觉与3D重构,SceniX则具备从建模到硬件的全栈机器人能力以及惊人的仿真能力。

对于机器人的基础模型,李飞飞与李昀烛认为,它本质上需要是一个多模态模型,必须同时考量视频帧、文本、图像、深度等多种模态,而动作是其中极其关键的一环。当将当前帧和动作作为输入时,它就是一个前向模拟器,用来预测环境变化;当把动作作为输出时,它就是一个策略模型,用来预测应采取什么动作。这种全能模型能为机器人领域带来巨大价值。

李昀烛强调,他的终极目标是让机器人真正干活,在真实环境中稳定运转。在收集到的上千个任务中,有三分之一都与清洁有关。他主张优先攻克半结构化场景的实用任务,而非盲目追求通用人形机器人。李飞飞也赞赏Scenix团队务实的态度,他们第一直觉就是与真实产业中的设计伙伴和客户紧密合作,无论是工业实验室、仓库,还是电子元器件装配线。