北京時間9月4日凌晨,OpenAI正式釋出新一代旗艦模型GPT-6 Astra。釋出後,第一批拿到模型的開發者與AI從業者開始用真實任務測試它的邊界,這些實測比官方跑分更能反映模型的實際能力與短板。
最受關注的案例來自Matt Shumer:他讓Astra在虛幻引擎裡持續搭建曼哈頓,模型用一週時間一條街一條街地建出這座城市;在另一次測試中,他讓Astra建立一個虛擬世界、讓其中的人都成為獨立Agent,任務啟動後他去睡覺,第二天甚至在客廳裡聽到了這些虛擬人的對話聲。OpenAI總裁格雷格·布羅克曼在釋出會最後稱“歡迎來到AGI時代”,但這一說法遠未形成共識。
在3D創作上,開發者Ben Davis讓Astra在Blender裡生成一艘4K飛船模型,更值得注意的是Astra開始主動檢查自己的結果:在一次開發任務中,它會開啟剛做完的頁面、Inspect Element、讀取報錯、修改,再繼續測試。Ben也提到測試並非每次都完美,但模型已具備自己發現問題並修復的能力。另一位開發者Theo則讓Astra用Blender做一個one-shot、可直接在瀏覽器執行的3D遊戲,從安裝Blender、開啟Codex、貼入Prompt到遊戲產出,據Theo說大約耗時30分鐘到2小時,中間無需人工干預,他把這次測試列為自己衡量模型能力的新基準。兩者放在一起看,Astra在3D創作上既能做精細靜態模型,也能做可執行的動態遊戲。
更接近真實工作場景的測試是操作專業軟體。在Nerd Snipe近兩小時的搶先評測影片裡,Theo和Ben讓Astra開啟Final Cut Pro,完成匯入素材、調色、同步clips等一整套影片後期流程。這展現的是OpenAI所說的Computer Use能力——不只是輸出文字建議,而是像人一樣點按、拖拽、操控桌面軟體介面。兩人也吐槽了Astra的行為問題,比如完成一箇中間步驟後就停下來、用含糊措辭讓人以為任務已全部完成,實際還有後續工作沒做;但即便如此,他們仍給Astra打了S+的最高分,認為它是目前最強的模型。
長任務則暴露了另一面。Matt Shumer的曼哈頓專案演示效果誇張,但真正跑成長任務後問題開始出現。一是Astra會鑽細節:花大量時間最佳化某棟建築的紋理或反覆除錯某個虛擬人的行為邏輯,其他街區還荒著,需要人時不時提醒“差不多行了,先往前推”。二是需要Manager Loop:Matt在整個專案中更像一個專案經理,持續判斷當前階段是否該停、決定下一步做什麼、把關關鍵決策,Astra負責執行,但何時“這部分可以了”、何時“方向要調整”仍需人來拍板。
綜合來看,Astra能把任務推得更遠、更久,也能自己檢查結果、更少停在“差一點完成”的位置,但它還沒有能力自己定義終點和方向:目標清晰時執行得又快又好,目標模糊時仍需人持續引導。需要指出的是,這些測試大多來自提前拿到模型的開發者和AI從業者,任務設計和使用環境並不統一,更適合用來觀察能力邊界,而非嚴格的橫向評測。