李飛飛創立的World Labs於9月釋出新一代世界模型Atlas,號稱“全球首個多模態世界模型”。該模型僅需一張圖片即可生成具有畫素級相機控制的影片,最高支援1440p解析度、時長1分鐘,並能完成3D場景重建,同時理解空間與時間。輝達機器人主管Jim Fan評論稱,這是機器人領域Real-to-Sim的一大步。

Atlas的核心能力包括相機控制生成、空間重建、時空模擬和影像生成。在空間重建方面,它能基於一張到數十張輸入影像重建真實世界場景,生成新視角影像或顯式3D表示,效果超過當前專門針對3D重建訓練的最先進模型。在時空模擬上,它能根據輸入影片同時建模空間和時間,轉換觀察視角,並支援機器人Real-to-Sim工作流。影像生成方面,它能根據文本生成圖片和360°全景圖,遵循複雜提示並準確渲染文字。

對於機器人模擬,僅需幾張照片,Atlas就能生成逼真的RGB和深度資料,使機器人能在更多不同的模擬空間中進行訓練和測試。這解決了具身智慧領域訓練資料稀缺、成本高昂的瓶頸。

技術架構上,Atlas採用多模態自迴歸擴散Transformer。多模態指它能原生處理文本、影像、相機位姿、3D深度圖等多種資料型別;自迴歸指它操作一系列元素組成的序列,每個元素可屬於任一模態;擴散模型部分採用Rectified Flow(校正流),通過逐步去噪生成輸出,推理時可通過調整去噪步數平衡速度與質量;Transformer則提供穩健的基礎架構。

該設計使Atlas既能利用LLM推理加速技術(如KV Cache、快取感知路由、解耦式服務),又能像現代影像影片生成模型一樣採用擴散蒸餾、無分類器引導等演算法,並引入更先進的VAE架構。研究團隊在相機控制生成和3D重建兩個關鍵任務上進行了定量評估,在稀疏輸入視角的3D重建任務中,Atlas超過了表現最好的專業開源3D重建模型。團隊表示已有證據表明Atlas的能力會隨規模擴大而繼續提高。

World Labs官方表示,Atlas將成為未來版Marble及其他產品的底層模型。此前,該公司於7月28日公開Real-to-Sim-to-Real系統,強調機器人最大瓶頸是缺乏廉價、可控、可規模化的訓練經驗。Atlas的釋出,打通了從真實照片/影片到3D空間再到機器人感測器檢視和模擬環境的路徑,為具身智慧的發展提供了關鍵基礎設施。