一項名為 StationeryBench 的新機器人基準測試,為 OpenAI 的 GPT-6 Astra 在空間推理能力上提供了早期證據。測試將 Astra 與 Ai2 的 MolmoAct2 放在同一套雙機械臂 YAM 機器人上對比,任務圍繞桌面物體操作展開,包括開啟馬克筆筆帽、倒出回形針、在兩條機械臂之間傳遞直尺等五類動作。兩款模型各進行 200 次試驗。
結果差距明顯:Astra 在 100 項任務中完整完成了 7 項,而 MolmoAct2 一項都沒能完成。若看部分完成度,Astra 的中位進度分為 46/100,MolmoAct2 僅為 12。所有結果、影片與程式碼均已釋出在 GitHub 上。
這一成績之所以受到關注,是因為它出現在機器人操作這一長期被視為大模型短板的領域。康奈爾大學與 Google DeepMind 的研究員 Yoav Artzi 將 Astra 的表現稱為空間推理的「階躍式變化」。他還提到,在尚未公開發布的 REMAP 基準上,GPT-Astra 的準確率已接近人類水平。不過 Artzi 也提醒,在其他場景中「即便是 Astra 也達不到人類的表現」,說明這一進步仍有邊界。
Artzi 推測,OpenAI 可能用大量 3D 資料訓練了該模型,例如 Blender 場景。這一猜測與 Astra 在 3D 任務上的突出改善相吻合。如果屬實,它指向一條不同於純文本或 2D 影像訓練的路徑:讓模型在三維空間中建立對物體位置、朝向與操作順序的理解。
從產業視角看,空間推理能力的提升對具身智慧與機器人訓練有直接含義。傳統機器人操作依賴大量真實世界試錯或精細的模擬環境,而一個具備更強空間理解的基礎模型,可能降低對特定任務資料的依賴,並讓同一模型遷移到更多桌面操作場景。OpenAI 本身也有自建消費級機器人的長期計劃,這類基準成績因此不只是學術指標,也可能反映其機器人路線的技術儲備。
需要強調的是,StationeryBench 的絕對完成率仍然很低——Astra 只完整完成了 7% 的任務,說明從「部分理解」到「可靠執行」之間仍有明顯距離。MolmoAct2 的零完成率也提示,當前不同模型在物理操作上的能力分化可能非常大。這些早期基準結果能否推廣到更復雜的真實環境,尚待更多獨立驗證。