OpenAI 的 GPT-6 Astra 在遊戲智慧體任務上交出了一份分化明顯的成績單:它在多款遊戲中大幅重新整理此前模型的通關速度,卻在《我的世界》裡因一次意外炸箱而長時間偏離主線。
據「GPT Plays Pokemon」專案運營者 Clad3815 的資料,Astra 用 18 小時 12 分鐘通關《寶可夢 火紅》,而 GPT-5.6 Sol 需要 96 小時 35 分鐘,GPT-5.5 在超過 218 小時後仍未通關。在《Factorio:太空時代》的社群測試中,Astra 通過自定義 Lua 模組與 MCP 介面操控,約 兩小時產出藍瓶、約 十小時發射首枚火箭;同一設定下,GPT-5.6 Luna 與 Fable 5.1 始終未能越過供電與石油勘探階段。此外,Astra 還通關了《Portal》並看到製作人員名單,用 22 小時通關《輻射 2》,在《邊緣世界》中帶領殖民地挺過多次襲擊並最終離開星球,以及用約 59 小時完成《輻射 3》主線。
在《我的世界》中,據 Vals AI 稱,此前沒有任何 AI 系統達到過 Astra 的進度。它在 141 小時後被 Vals AI 叫停,期間在 下界建起半自動烈焰人農場,在詭異森林擊殺超過六隻末影人,並集齊製作末影之眼所需材料。直播中數千人觀看它把戰利品放入箱子,隨後一隻 苦力怕炸燬了箱子和床,物品盡失,且當時開始下雨。Astra 記下一條部分大寫的筆記:「永遠隨身攜帶關鍵物品」,並稱不要再把物品存放在無人看管的箱子裡。此後它花了數小時幾乎只種土豆。
這一表現與 ARC-AGI-3 基準的結果相呼應。該基準把模型放入陌生抽象遊戲環境,要求其通過自身行動推斷規則。Astra 在標準介面下得分 62.7%,在 OpenAI 自有測試框架下約 99.9%;GPT-5.6 Sol 為 7.78%,Claude Opus 5 略高於 30%。ARC Prize 解釋稱,Astra 能把不熟悉的遊戲機制轉化為緊湊的符號描述,並用自創的簡寫跟蹤物體、座標、規則與計劃動作,觀察變成規則、規則變成計劃。
這一思路並非全新。2023 年由輝達與加州理工參與的研究專案 Voyager 曾讓 GPT-4 在《我的世界》中提出任務、編寫 JavaScript 程式碼並根據報錯修改,把可用程式存入技能庫,但它從未「看到」遊戲畫面,而是通過結構化資料和 Mineflayer 介面操控。Vals AI 的《我的世界》執行則通過通用計算機操作,即螢幕、滑鼠與鍵盤,沒有專用遊戲介面。研究者過去圍繞模型搭建的框架,Astra 如今自行完成。
《輻射 3》的執行也呈現類似結構。使用者 imjustnewatai 在 YouTube 釋出完整過程,自己完成 101 號避難所開場後將存檔交給 OpenAI 的智慧體工具 Codex,Astra 設為最高推理級別,自行選擇路線與行動,經歷銀河新聞電台、尋找父親、G.E.C.K.、逃離烏鴉巖、淨水計劃等節點,以暫停、觀察、行動的迴圈通過正常遊戲輸入推進,允許存檔、同伴與快速旅行,約 59 小時後製作人員名單滾動。
ARC Prize 描述的模式在 87 號避難所一段最為明顯:角色多次死亡、彈藥耗盡,Astra 不得不回撤治療。它沒有重複無效動作,而是尋找原因並記錄結果。例如床起初未響應,它讓遊戲執行片刻後重試,並報告生命值已完全恢復至 260/260;射擊屢屢未中,它判斷有障礙物遮擋,靠近後記錄「靠近清除了此前影響射擊的障礙」;在鍵盤鎖前,它等到遊戲確認按鍵後才繼續。Astra 最終把這些歸納為一條原則:在重複輸入前先確認它是否生效。這看似簡單,卻是防止智慧體陷入無效迴圈的關鍵,也可能成為後續行為問題的起點。