李飛飛創辦的World Labs於近日釋出新一代多模態世界模型Atlas,該模型從零開始預訓練,原生處理文本、影像、影片和3D資料,支援可控運鏡、空間重建、時空模擬和影像生成等廣泛任務。據官方披露,Atlas可輸出長達1分鐘1440p影片,並面向部分合作夥伴開放早期訪問,而非全面上線。

Atlas的核心能力包括:利用畫素級相機控制從一張或多張影像生成影像和影片;根據一張或數十張輸入影像重建真實世界場景,效能優於目前最先進的3D重建專用模型;通過輸入影片對空間和時間建模,為機器人實現真實到模擬的工作流程;以及根據文本生成影像和360度全景圖。其技術架構採用多模態自迴歸擴散Transformer,序列元素逐個生成,視覺輸出通過去噪產生,相機位姿和深度也是模型處理的資料型別。

World Labs由李飛飛與Justin Johnson、Ben Mildenhall、Christoph Lassner於2024年共同創辦。李飛飛曾推動ImageNet及相關競賽,是現代計算機視覺發展的重要基礎,並於2017至2018年擔任谷歌副總裁及Google Cloud AI/ML首席科學家。聯合創始人中,Ben Mildenhall是NeRF論文的共同第一作者,Justin Johnson研究視覺推理和三維推理,Christoph Lassner則開發過Pulsar渲染後端。團隊背景集中在視覺、圖形學和三維表示,而非單純語言建模。

Atlas的釋出並非一蹴而就。World Labs於2024年12月首次展示可探索的三維世界,2025年9月推出Marble早期測試,並於同年11月12日正式向所有使用者開放。Marble允許使用者從文本、影像、影片和三維佈局生成世界,並可編輯、擴充套件、合併場景。2025年10月,團隊公開了RTFM(Real-Time Frame Model)研究線,探索“學習出來的渲染器”,目標是在單張H100上實現互動式幀率。2026年1月,World Labs推出World API,讓開發者以程式方式呼叫Marble的世界生成能力。Atlas被視作沿這些路線向統一模型推進的關鍵一步。

2026年6月,World Labs發表文章將世界模型分為渲染器、模擬器和規劃器三類,強調模擬器需對幾何和動態行為負責。為補齊機器人能力,7月21日公司收購了機器人公司SceniX,一週後釋出Real-to-Sim-to-Real技術進展,展示線纜操作、試管轉移等任務,部分演示報告了連續一小時無需人工干預的執行結果。

World Labs的研發路線也解釋了其鉅額融資需求。2026年2月,公司宣佈新增10億美元融資,投資者包括AMDAutodesk輝達Fidelity等。其中Autodesk單獨披露了2億美元戰略投資,並表示將在研究和模型層面開展合作。晶片公司與設計軟體公司的同時出現,一端關係到訓練和推理成本,另一端關係到模型能否進入專業生產流程。Autodesk在投資說明中強調空間、結構、材料、物理和時間,反映出專業軟體使用者對AI的要求與普通影像生成使用者不同。

Atlas的釋出展示了世界模型在統一多模態生成與空間理解上的進展,其可控運鏡和空間重建能力對影視製作、機器人訓練等應用具有潛在價值。然而,生成效果合理不代表其符合現實,模型在模擬器可靠性方面仍需驗證。World Labs能否將技術優勢轉化為可持續的產品和商業閉環,尚待觀察。