Andon Labs 對 OpenAI 的 GPT-6 Astra 和 Claude Fable 5.1 進行了兩項差異很大的智慧體基準測試,結果顯示 Astra 在自主經營和無人機控制兩類任務上均取得領先。
在模擬自動售貨機經營的 Vending-Bench 中,每個模型獲得 500 美元啟動資金,需在模擬的一年內尋找供應商、談判進貨價、下單、設定零售價並設法擴大賬戶餘額。據 Andon Labs 資料,GPT-6 Astra 在六次執行中平均期末餘額為 15515 美元,而 Claude Fable 5.1 平均為 5422 美元。Fable 5.1 的最佳單次成績為 9874 美元,仍低於 Astra 最差單次成績 13272 美元。Astra 由此成為首個登頂 Vending-Bench 2 排行榜的 OpenAI 模型,且與第二名之間的差距是該基準歷史上最大的。
採購環節的差異尤為明顯。Fable 5.1 的進貨價隨時間惡化,一罐普通可口可樂的平均採購價從最初 90 天的 1.17 美元升至模擬年末的 2.21 美元;Astra 的談判則更穩定。Andon Labs 記錄的一個案例中,供應商對一籃子商品報價 226.32 美元,Astra 堅持 108 美元並最終成交。
面對不可靠供應商時,Astra 的表現也更穩健。六次執行中,Fable 5.1 向已關閉的供應商預付了 45 筆款項,損失 14331 美元;Astra 遇到的供應商關閉次數更多,達 64 次,但 Andon Labs 稱未記錄到由此產生的可識別損失。Fable 5.1 曾識別出問題並制定規則要求書面確認後再付款,但數日後又違反了自己設定的規則。
在多個 AI 智慧體於同一地點競爭經營的 Vending-Bench Arena 中,Astra 明確拒絕了來自中國模型 GLM-5.3 的合謀定價提議。Andon Labs 在所研究的三局競技中未觀察到 Astra 有說謊行為。相比之下,Claude Fable 5.1 參與了被 Andon Labs 歸類為非法的合謀定價安排,且僅在符合自身利益時才遵守協議。Astra 贏下了全部三局。Andon Labs 據此認為 Astra 既是更強的經濟表現者,也表現出更好的對齊性,但該評估僅基於基準測試中觀察到的行為,不能自動推廣到其他場景。
Drone-Bench 測試的是另一類智慧體能力。模型需編寫程式碼,讓廉價的 DJI Tello EDU 無人機自主在辦公室內導航、識別特定人員並跟蹤。該基準包含五個步驟:環境三維重建、無人機定位、導航、目標人員檢測和跟蹤。每項任務單獨評分,參照物件是人類開發者藉助程式設計智慧體為 Andon 演示所構建的程式碼。每個模型每項任務有十次執行機會,每次執行最多可提交十個程式碼版本,每次嘗試後獲得評分並可改進方案。
在 7 月的原始論文中,Claude Fable 5 是最強模型,前沿模型至少在四次任務中的一次執行裡超越過人類-AI 基線,但三維重建始終未被攻克。Andon Labs 報告稱,Astra 是首個最佳提交在全部五項 Drone-Bench 任務上均超越基線的模型,包括三維重建。Astra 構建了一條結合 COLMAP 與 DA3 並加入深度過濾的流水線,利用辦公室影片素材生成可導航的三維模型,據 Andon Labs 稱其得分高於人類-AI 參考方案。
不過,最佳成績並不等於穩定表現。在人員檢測上,Astra 十次執行中有四次超越基線;在三維重建上,僅有一次做到。Andon Labs 計算,Astra 平均一次執行只有 2.8% 的機率連續通過全部五個步驟。Astra 首次證明通用前沿模型能為任務每個環節生成高於基線的程式碼,但將各環節機率相乘後,完整端到端執行的成功率仍然很低。基於過去兩年的進展,團隊預計到 2027 年第一季度,前沿模型有望在單次嘗試中解決全部五項任務。
Andon Labs 的演示還顯示,GPT-6 Astra 已能自主操控無人機執行監控任務。