斯坦福與加州理工學院的研究團隊構建了一套名為 HomeBody 的系統,讓一台 宇樹 G1 人形機器人在完全陌生的廚房環境中自主探索、整理物品,並能從抽屜中取出指定物件。這被視為又一項驗證 GPT-6 Astra 與機器人硬體協同能力的測試。
HomeBody 的核心設計思路是去掉語言模型與機器人之間通常存在的、經過專門訓練的控制層。取而代之的是一個可替換的視覺語言模型(VLM),在本實驗中即 GPT Astra,它直接呼叫一個可擴充套件的技能庫,涵蓋抓取、導航、開啟抽屜等模組化動作。這種架構意味著模型本身承擔了從理解任務到排程底層動作的絕大部分決策工作,而不再依賴為特定機器人專門訓練的策略網路。
在具體流程上,機器人會先對房間進行探索,在 輝達 Isaac Sim 模擬環境中構建一個數字孿生,並把物體及其位置記錄進空間記憶。這一空間記憶機制使機器人即便在物品離開視野後,仍能定位並找到它們。面對“清理廚房”這類複合任務,語言模型會自行規劃每一步,並在出現錯誤時進行自我糾正。
研究團隊也列出了當前系統的若干侷限:Astra 的延遲、手指舵機過熱,以及較高的算力成本。相關程式碼已在 GitHub 上公開。
從背景看,此前已有基準測試顯示 Astra 在空間推理方面有顯著提升,但另一項測試則指出,當 Astra 用於控制機器人時存在安全問題。與此同時,OpenAI 已宣佈計劃重返機器人領域,包括面向個人使用的方向。HomeBody 的實驗因此處在兩條線索的交匯處:一是大模型作為通用“大腦”直接驅動機器人的可行性,二是這類端到端控制方式在即時性與安全性上的現實約束。
對關注 AI 產業的讀者而言,這項工作的意義在於它把“模型能力”與“機器人本體”之間的中間層進一步壓縮。若該路徑可複製,機器人軟體的開發門檻可能從“為每個任務訓練專用策略”轉向“維護一套可呼叫的技能庫加一個足夠強的模型”,這會改變具身智慧的研發分工,也會讓推理算力、模擬工具與機器人硬體的需求結構發生變化。但延遲、散熱與成本這三項限制,恰恰指向當前從演示走向實用仍需跨越的工程障礙。