一项名为 StationeryBench 的新机器人基准测试,为 OpenAI 的 GPT-6 Astra 在空间推理能力上提供了早期证据。测试将 Astra 与 Ai2 的 MolmoAct2 放在同一套双机械臂 YAM 机器人上对比,任务围绕桌面物体操作展开,包括打开马克笔笔帽、倒出回形针、在两条机械臂之间传递直尺等五类动作。两款模型各进行 200 次试验。
结果差距明显:Astra 在 100 项任务中完整完成了 7 项,而 MolmoAct2 一项都没能完成。若看部分完成度,Astra 的中位进度分为 46/100,MolmoAct2 仅为 12。所有结果、视频与代码均已发布在 GitHub 上。
这一成绩之所以受到关注,是因为它出现在机器人操作这一长期被视为大模型短板的领域。康奈尔大学与 Google DeepMind 的研究员 Yoav Artzi 将 Astra 的表现称为空间推理的「阶跃式变化」。他还提到,在尚未公开发布的 REMAP 基准上,GPT-Astra 的准确率已接近人类水平。不过 Artzi 也提醒,在其他场景中「即便是 Astra 也达不到人类的表现」,说明这一进步仍有边界。
Artzi 推测,OpenAI 可能用大量 3D 数据训练了该模型,例如 Blender 场景。这一猜测与 Astra 在 3D 任务上的突出改善相吻合。如果属实,它指向一条不同于纯文本或 2D 图像训练的路径:让模型在三维空间中建立对物体位置、朝向与操作顺序的理解。
从产业视角看,空间推理能力的提升对具身智能与机器人训练有直接含义。传统机器人操作依赖大量真实世界试错或精细的仿真环境,而一个具备更强空间理解的基础模型,可能降低对特定任务数据的依赖,并让同一模型迁移到更多桌面操作场景。OpenAI 本身也有自建消费级机器人的长期计划,这类基准成绩因此不只是学术指标,也可能反映其机器人路线的技术储备。
需要强调的是,StationeryBench 的绝对完成率仍然很低——Astra 只完整完成了 7% 的任务,说明从「部分理解」到「可靠执行」之间仍有明显距离。MolmoAct2 的零完成率也提示,当前不同模型在物理操作上的能力分化可能非常大。这些早期基准结果能否推广到更复杂的真实环境,尚待更多独立验证。