由 AI 先驅李飛飛創立的 World Labs 於 8 月 15 日釋出了一款名為“Real-to-Sim-to-Real”(R2S2R)的模擬引擎,該引擎能在完全虛擬的環境中訓練機器人控制系統,並將單個真實世界任務轉化為數千種受控變體,從而大幅減少對昂貴硬體測試的依賴。據公司介紹,訓練後的模型在五種不同機器人平台上各運行了一小時,期間無需任何人工干預。

World Labs 表示,機器人部署的主要瓶頸並非模型架構,而是機器人需要大量經驗才能可靠執行。真實世界的資料成本高昂且難以控制,即使是網路影片也無法系統覆蓋所有物體、物理條件和失敗狀態。R2S2R 引擎通過結合生成式世界模型與任務導向的機器人模擬,將機器人、感測器、環境和任務演示重建為一個互動式虛擬世界,該世界不僅外觀與原始環境相似,物理行為也保持一致。

從單個真實任務出發,系統通過改變光照、物體位置和數量、周圍環境、摩擦等物理屬性以及相機角度,生成數千種變體。為驗證準確性,World Labs 會在模擬和現實中並行執行相同的動作序列,並比較觀察結果、物體運動和最終結果。示例任務包括電纜佈線、將彈性電纜末端插入孔中以及雙手裝箱等,涉及剛性、可移動和可變形物體。

控制模型完全在模擬中訓練,然後遷移到真實機器人上。測試平台之一是 ALOHA,這是斯坦福大學開源的雙臂設計,通過兩個較小的控制臂進行操控。該裝置成本僅為商用系統的一小部分,且所有藍圖公開,使其成為機器人研究領域的參考平台。據 World Labs 稱,模型在另外四個機器人平台上各執行一小時,任務包括雙手將電源線纏繞在冰箱上、精確重新定位試管以及從密集堆中分離細長物體(如記號筆或鉛筆)等。

該系統不依賴於特定控制模型或機器人型別,因此重建一次的世界可重複用於新模型和不同機器人。World Labs 認為,機器人開發之所以落後於語言模型,很大程度上是因為評估控制模型主要依賴真實硬體測試。一個可靠的模擬不需要達到與真實環境相同的成功率,關鍵在於能否回答同樣的問題:模型在哪裡失敗、哪個版本更好、改進是否能遷移到物理機器人上。

團隊用 ALOHA 機器人的雙臂進行立方體交接測試,模擬成功復現了機器人勉強抓住立方體邊緣的臨界情況以及匹配的失敗嘗試。在不同模型型別(包括 GR00T N1.6 和 π₀.₅)和訓練階段中,模擬與現實的模型排名基本保持一致,無論立方體位置是否已知。每個檢查點使用 2,000 次模擬和 100 次真實執行進行評估。開發團隊可以在模擬中篩選出較弱的模型版本,將昂貴的硬體測試留給最有潛力的候選者。

該模擬器是 World Labs 更廣泛戰略的核心部分。公司將其與世界模型分類法聯絡起來,認為模擬器是將世界轉變為軟體代理可以行動、學習和測試的場所的關鍵。World Labs 還類比自動駕駛領域,指出一些成功的 L3 和 L4 系統混合使用真實和模擬資料進行訓練。公司的長期目標是通過擴充套件機器人學習的世界來擴充套件機器人的智慧。

然而,這些結果能否遷移到更復雜的環境、其他機器人型別以及更不受控制的日常場景,仍是一個開放問題。World Labs 成立於 2024 年,由李飛飛創立,旨在構建理解三維物理世界的空間智慧模型。早期系統可從單張照片生成可步行的 3D 環境。近期,公司籌集了 10 億美元風險投資,將世界模型擴充套件到機器人和科學領域。R2S2R 引擎是該願景在機器人領域的首個具體應用。

這項研究也引發了關於世界模型在機器人中作用的更廣泛討論。一個國際研究團隊最近試圖定義世界模型的統一標準,將其與純影片生成器明確區分。相關領域還包括“世界動作模型”,它將近期預測直接與控制命令繫結,這與 World Labs 將模擬和策略分離的方法不同。另一種名為 Orca 的方法來自中國,允許機器人僅通過觀看影片學習任務,無需真實運動資料。