李飞飞创立的World Labs于9月发布新一代世界模型Atlas,号称“全球首个多模态世界模型”。该模型仅需一张图片即可生成具有像素级相机控制的视频,最高支持1440p分辨率、时长1分钟,并能完成3D场景重建,同时理解空间与时间。英伟达机器人主管Jim Fan评论称,这是机器人领域Real-to-Sim的一大步。
Atlas的核心能力包括相机控制生成、空间重建、时空模拟和图像生成。在空间重建方面,它能基于一张到数十张输入图像重建真实世界场景,生成新视角图像或显式3D表示,效果超过当前专门针对3D重建训练的最先进模型。在时空模拟上,它能根据输入视频同时建模空间和时间,转换观察视角,并支持机器人Real-to-Sim工作流。图像生成方面,它能根据文本生成图片和360°全景图,遵循复杂提示并准确渲染文字。
对于机器人模拟,仅需几张照片,Atlas就能生成逼真的RGB和深度数据,使机器人能在更多不同的模拟空间中进行训练和测试。这解决了具身智能领域训练数据稀缺、成本高昂的瓶颈。
技术架构上,Atlas采用多模态自回归扩散Transformer。多模态指它能原生处理文本、图像、相机位姿、3D深度图等多种数据类型;自回归指它操作一系列元素组成的序列,每个元素可属于任一模态;扩散模型部分采用Rectified Flow(校正流),通过逐步去噪生成输出,推理时可通过调整去噪步数平衡速度与质量;Transformer则提供稳健的基础架构。
该设计使Atlas既能利用LLM推理加速技术(如KV Cache、缓存感知路由、解耦式服务),又能像现代图像视频生成模型一样采用扩散蒸馏、无分类器引导等算法,并引入更先进的VAE架构。研究团队在相机控制生成和3D重建两个关键任务上进行了定量评估,在稀疏输入视角的3D重建任务中,Atlas超过了表现最好的专业开源3D重建模型。团队表示已有证据表明Atlas的能力会随规模扩大而继续提高。
World Labs官方表示,Atlas将成为未来版Marble及其他产品的底层模型。此前,该公司于7月28日公开Real-to-Sim-to-Real系统,强调机器人最大瓶颈是缺乏廉价、可控、可规模化的训练经验。Atlas的发布,打通了从真实照片/视频到3D空间再到机器人传感器视图和模拟环境的路径,为具身智能的发展提供了关键基础设施。