斯坦福大學 The Movement Lab 與加州理工學院近日公開了一個名為 HomeBody 的研究專案,將 GPT Astra 接入宇樹 G1 人形機器人,讓機器人先自主探索陌生廚房,再根據人的指令完成找東西、拿藥、扔垃圾和開抽屜等連續任務。與當前行業熱門的端到端視覺-語言-動作模型(VLA)路線不同,HomeBody 刻意不讓大模型直接輸出關節動作,而是把大模型與機器人身體之間的介面重新設計成一套結構化的技能呼叫層。

這套系統的核心思路是:GPT Astra 每次判斷後,通過結構化 tool call 選擇一個技能,並提供該技能所需的引數。不同技能對應不同的命令空間——Pick 接收當前影像中歸一化到 0–1000 的二維點並指定左手或右手;Navigate 接收地圖座標系中的二維目標點和朝向點;Place 使用機器人軀幹座標系中的三維釋放位置、執行手及釋放距離;抽屜操作則把視覺對準、掛住把手和向後行走封裝成一個完整技能。大模型只在語義空間表達“要操作哪個目標”,技能介面再把這個意圖逐層轉化為機器人可執行的幾何約束。Astra 不需要理解 G1 的每個自由度,也不需要知道逆運動學求解器如何工作。

這種設計與端到端 VLA 的關鍵區別在於中間層被拆成顯式介面。抓取可由解析方法實現,導航可接傳統規劃器,新技能也可來自強化學習策略——只要輸入輸出遵循同一套協議,上層 VLM 並不需要知道底層用了哪種控制方法。由此,機器人擴充套件能力的難點從重新訓練整條策略,轉移到了介面本身能否表達任務所需的狀態。

但問題隨之而來:二維影像點可以告訴 Pick 抓什麼,卻無法告訴 Navigate 幾分鐘前看到的藥瓶位於房間哪一側。一旦任務跨越多個房間位置,VLM 就不能只依賴當前相機畫面,需要把視覺語義與真實世界的米制座標接起來。為此,G1 在執行任務前先探索環境,同步儲存相機觀測、D435i 雙目資料、LiDAR 與 SLAM 資訊、關節姿態以及 Astra 選擇過的航點。隨後 Astra 參與 Real2Sim 流程,把這些觀測整理成 Isaac Sim 中的數字環境。系統執行時先通過 Super Odometry 得到 G1 在現實 SLAM 地圖中的狀態,再利用 ICP(Iterative Closest Point)把 SLAM 點雲與 Isaac Sim 重建環境配準,使現實地圖與數字環境共享一套空間關係。空間記憶由此被拆成兩層:一層是語義記憶,儲存某張關鍵幀裡出現了什麼;另一層是度量幾何,儲存拍攝該圖時機器人位於哪裡。官方對比顯示,僅靠人工拍攝影片重建時房間尺寸需根據視覺外觀估計;加入機器人自身採集的 SLAM 幾何後,房間佈局和尺度受到實測點雲約束,數字環境才適合繼續用於導航和空間推理。

當機器人真正走到抽屜前,問題從米級導航突然收縮到釐米級操作。Pick 技能的輸入雖然只是一個二維點,但系統先用該點提示分割模組把目標從背景中切出,隨後 Fast-FoundationStereo 根據 D435i 雙目影像計算深度,再利用相機標定關係把 mask 內畫素投影成三維幾何,通過解析方法生成抓取姿態。運動規劃器生成 spline reference,並使用 minimum-jerk timing 約束軌跡,沿軌跡逐點求逆運動學,同時檢查整條 swept motion 的碰撞間隙。然而離線規劃仍解決不了運動過程中的視覺漂移——人形機器人靠近桌子時身體移動、頭部相機視角改變,最初投影的三維目標即使只偏幾釐米也足以導致抓取失敗。系統因此繼續使用 SAM 2.1 跟蹤目標,並結合 SAMURAI 的 memory selection 維持跨幀目標狀態,再通過 visual servoing 持續修正接近方向。

這裡形成了一個重要的閉環分層:小範圍視覺誤差由 servo loop 直接修正;機械手閉合卻未建立接觸時,Pick 技能可換一個 grasp candidate 或改變機器人站位後重新規劃,且嘗試有明確次數邊界;只有區域性恢復無法處理時,技能才把失敗原因返回 Astra,讓 VLM 決定重新定位、換目標或調整任務順序。大模型因此沒有進入每一次糾偏,它負責離散任務狀態轉移,本地模組負責連續狀態穩定。兩者時間尺度也完全不同:手臂和手部控制命令執行在 250 Hz,AMO 每 5 個控制 tick 更新一次,相當於 50 Hz,而 GPT Astra 的遠端推理處在秒級。把三種尺度硬塞進同一個策略裡,網路抖動和模型推理時間會直接影響身體控制;分開之後,大模型停頓主要發生在技能切換處。

抽屜操作把這種分層推到了全身控制。機械手掛住把手後,若只讓手臂向後移動,很快會遇到工作空間和身體平衡限制。系統會讓機器人向後走,同時維持上肢操作目標。這裡使用的 AMO 是一套將 Sim2Real 強化學習與軌跡最佳化結合的全身控制框架,訓練目標之一就是讓 G1 在面對超出常規分佈的上肢目標時,仍能通過下肢和軀幹調整擴大可操作空間。至此整套技術鏈閉合:VLM 輸出任務級目標,空間記憶把歷史視覺變成地圖位置,感知模組把二維目標恢復成三維幾何,規劃器生成可執行軌跡,視覺伺服吸收區域性誤差,全身控制器負責讓動作在真實 G1 上保持穩定。

這套系統目前仍有明顯的工程邊界。Real2Sim 會增加部署準備和 API 成本,Astra 的遠端推理會在技能之間產生停頓,本地感知和規劃目前需要一台 RTX 4090 筆記本執行,更重的視覺模型會繼續推高計算需求。長時間任務還受到機械臂工作空間、手部舵機發熱以及硬體耐久度限制。更大的問題來自技能覆蓋範圍:Astra 可以重新安排 Pick、Place、Navigate 和 Open Drawer,卻不能僅靠語言推理生成一種從未實現過的接觸動力學——技能庫沒有擦桌子,就無法因為一句指令自動獲得穩定的擦拭控制。

不過這種限制反過來也說明了架構方向。HomeBody 沒有要求一個 VLA 同時學習空間記憶、任務分解、三維視覺、抓取、碰撞規避和全身動力學,而是把這些問題拆成各自適合的表示和控制頻率,再通過顯式介面連線。VLM 面對技能和狀態,SLAM 面對幾何空間,視覺模型面對畫素與深度,運動規劃器面對軌跡約束,AMO 面對整具身體的動力學。人形機器人因而開始出現一種更接近複雜軟體系統的結構:高層模型負責離散決策,空間系統維護外部狀態,技能提供標準化呼叫介面,高頻控制層承擔物理穩定性。HomeBody 目前展示的能力還有限,但它提出的問題已經很具體——接下來具身智慧的競爭可能不只是誰能訓練出更大的動作模型,還包括誰能設計出更合理的技能介面、更穩定的空間狀態表示,以及更清晰的高低頻控制邊界。