李飞飞创办的World Labs于近日发布新一代多模态世界模型Atlas,该模型从零开始预训练,原生处理文本、图像、视频和3D数据,支持可控运镜、空间重建、时空模拟和图像生成等广泛任务。据官方披露,Atlas可输出长达1分钟的1440p视频,并面向部分合作伙伴开放早期访问,而非全面上线。
Atlas的核心能力包括:利用像素级相机控制从一张或多张图像生成图像和视频;根据一张或数十张输入图像重建真实世界场景,性能优于目前最先进的3D重建专用模型;通过输入视频对空间和时间建模,为机器人实现真实到模拟的工作流程;以及根据文本生成图像和360度全景图。其技术架构采用多模态自回归扩散Transformer,序列元素逐个生成,视觉输出通过去噪产生,相机位姿和深度也是模型处理的数据类型。
World Labs由李飞飞与Justin Johnson、Ben Mildenhall、Christoph Lassner于2024年共同创办。李飞飞曾推动ImageNet及相关竞赛,是现代计算机视觉发展的重要基础,并于2017至2018年担任谷歌副总裁及Google Cloud AI/ML首席科学家。联合创始人中,Ben Mildenhall是NeRF论文的共同第一作者,Justin Johnson研究视觉推理和三维推理,Christoph Lassner则开发过Pulsar渲染后端。团队背景集中在视觉、图形学和三维表示,而非单纯语言建模。
Atlas的发布并非一蹴而就。World Labs于2024年12月首次展示可探索的三维世界,2025年9月推出Marble早期测试,并于同年11月12日正式向所有用户开放。Marble允许用户从文本、图像、视频和三维布局生成世界,并可编辑、扩展、合并场景。2025年10月,团队公开了RTFM(Real-Time Frame Model)研究线,探索“学习出来的渲染器”,目标是在单张H100上实现交互式帧率。2026年1月,World Labs推出World API,让开发者以程序方式调用Marble的世界生成能力。Atlas被视作沿这些路线向统一模型推进的关键一步。
2026年6月,World Labs发表文章将世界模型分为渲染器、模拟器和规划器三类,强调模拟器需对几何和动态行为负责。为补齐机器人能力,7月21日公司收购了机器人公司SceniX,一周后发布Real-to-Sim-to-Real技术进展,展示线缆操作、试管转移等任务,部分演示报告了连续一小时无需人工干预的运行结果。
World Labs的研发路线也解释了其巨额融资需求。2026年2月,公司宣布新增10亿美元融资,投资者包括AMD、Autodesk、英伟达、Fidelity等。其中Autodesk单独披露了2亿美元战略投资,并表示将在研究和模型层面开展合作。芯片公司与设计软件公司的同时出现,一端关系到训练和推理成本,另一端关系到模型能否进入专业生产流程。Autodesk在投资说明中强调空间、结构、材料、物理和时间,反映出专业软件用户对AI的要求与普通图像生成用户不同。
Atlas的发布展示了世界模型在统一多模态生成与空间理解上的进展,其可控运镜和空间重建能力对影视制作、机器人训练等应用具有潜在价值。然而,生成效果合理不代表其符合现实,模型在模拟器可靠性方面仍需验证。World Labs能否将技术优势转化为可持续的产品和商业闭环,尚待观察。