斯坦福与加州理工学院的研究团队构建了一套名为 HomeBody 的系统,让一台 宇树 G1 人形机器人在完全陌生的厨房环境中自主探索、整理物品,并能从抽屉中取出指定物件。这被视为又一项验证 GPT-6 Astra 与机器人硬件协同能力的测试。

HomeBody 的核心设计思路是去掉语言模型与机器人之间通常存在的、经过专门训练的控制层。取而代之的是一个可替换的视觉语言模型(VLM),在本实验中即 GPT Astra,它直接调用一个可扩展的技能库,涵盖抓取、导航、打开抽屉等模块化动作。这种架构意味着模型本身承担了从理解任务到调度底层动作的绝大部分决策工作,而不再依赖为特定机器人专门训练的策略网络。

在具体流程上,机器人会先对房间进行探索,在 英伟达 Isaac Sim 仿真环境中构建一个数字孪生,并把物体及其位置记录进空间记忆。这一空间记忆机制使机器人即便在物品离开视野后,仍能定位并找到它们。面对“清理厨房”这类复合任务,语言模型会自行规划每一步,并在出现错误时进行自我纠正。

研究团队也列出了当前系统的若干局限:Astra 的延迟、手指舵机过热,以及较高的算力成本。相关代码已在 GitHub 上公开。

从背景看,此前已有基准测试显示 Astra 在空间推理方面有显著提升,但另一项测试则指出,当 Astra 用于控制机器人时存在安全问题。与此同时,OpenAI 已宣布计划重返机器人领域,包括面向个人使用的方向。HomeBody 的实验因此处在两条线索的交汇处:一是大模型作为通用“大脑”直接驱动机器人的可行性,二是这类端到端控制方式在实时性与安全性上的现实约束。

对关注 AI 产业的读者而言,这项工作的意义在于它把“模型能力”与“机器人本体”之间的中间层进一步压缩。若该路径可复制,机器人软件的开发门槛可能从“为每个任务训练专用策略”转向“维护一套可调用的技能库加一个足够强的模型”,这会改变具身智能的研发分工,也会让推理算力、仿真工具与机器人硬件的需求结构发生变化。但延迟、散热与成本这三项限制,恰恰指向当前从演示走向实用仍需跨越的工程障碍。