OpenAI 釋出了名為 GPT-6 Astra 的新模型,定位不再是單純的對話生成,而是直接面向計算機應用、程式設計、專業工作流程、科學和網路安全場景。該模型最初只向部分組織開放,隨後逐步推向 ChatGPT Plus、Pro、Business 和 Enterprise 使用者,以及 OpenAI API、Microsoft Azure 和 AWS Bedrock 的開發者。

這次釋出最核心的變化,是 OpenAI 把模型的應用範圍從“生成響應”擴充套件到了“直接在軟體中執行多步驟任務”。按官方描述,Astra 能與圖形介面互動,可以填寫表單、更新 CRM 記錄、開展研究、建立網站、分析資料、安裝和測試軟體,還能排查那些可以從螢幕上直接看出來的問題。在衡量計算機操作能力的 OSWorld 2.0 測試中,OpenAI 報告 Astra 得分 72.6%,高於 GPT-5.6 Sol65.7%

程式設計是本次釋出的另一個重點。OpenAI 報告稱,Astra 在 Terminal-Bench 4.0 上得分 57.9%,在 DeepSWE v1.1 上得分 74.1%。它還在 Codex 中引入了一種實驗性的上下文機制,讓智慧體能夠在不同上下文視窗之間保留筆記,而不再只依賴壓縮機制;此前的上下文視窗仍可被搜尋,使模型在長時間執行的程式設計任務中能檢索早期需求、測試結果和工具輸出。在 OpenAI 公佈的 MRCR 評估中,該模型支援長達 100 萬個令牌的長上下文,在 512K 至 1M 的上下文範圍內得分達到 96.3%。OpenAI 還表示,Astra 在資料庫遷移、CAD 生成、資料科學、瀏覽器研究和科學工作流等專業任務上也有進步。

網路安全方面的變化更值得注意。按照 OpenAI 的 Preparedness Framework,Astra 是首個被歸類為“關鍵網路安全能力”級的模型。OpenAI 稱,在未啟用生產環境安全防護措施的測試中,該模型發現了兩個此前未知的漏洞並加以利用,同時展示了針對經過強化防護的瀏覽器和作業系統開發漏洞利用程式的能力。生產版本對高階攻擊任務做了限制,OpenAI 計劃通過其 Daybreak 計劃提供更廣泛的防禦能力。

在可靠性指標上,OpenAI 報告 Astra 的內部評估幻覺率為 4.2%,低於 GPT-5.6 Sol12.2%。但在測試模型是否會掩蓋其推理過程時,OpenAI 發現 Astra 的書面推理比前代模型更難監控,公司表示提高可監控性仍是當前研究重點。

競爭格局方面,Astra 的對標物件包括 Anthropic Claude Fable 5.1 和谷歌的 Gemini 3.8 Flash 等模型。OpenAI 公佈的評估結果顯示,各模型在不同任務中表現各異:Astra 在 Terminal-Bench 4.0 以及多項計算機使用評估中領先;而在 Humanity's Last Exam 測試中,Claude Fable 5.1 得分更高;此外,Gemini 3.8 Flash 支援原生影片和音訊輸入,Astra 則不支援。

社群反響中,輝達執行長 黃仁勳 重點提到了訓練該模型的基礎設施,稱 GPT-6 Astra 是在 10 萬多塊 NVIDIA Grace Blackwell NVLink72 上完成訓練,從 ChatGPT 到 o1 再到 Astra 僅用了 4 年,並表示接下來將有 40 萬塊 GPU 投入使用。另一位社群代表 Alex Finn 則聚焦此次釋出所體現的 AGI 框架,稱當前已進入 AGI 時代。

把這些資訊放在一起看,Astra 的意義不只是又一輪模型能力重新整理。它把智慧體的執行邊界從“回答問題”推向“操作軟體、完成多步驟工作流”,這對企業軟體、程式設計工具和自動化流程的想象空間是直接的;同時,首個“關鍵網路安全能力”分級也把模型能力與安全治理的矛盾擺上檯面——能力越強,可監控性與濫用風險越需要配套機制。對關注 AI 產業的人而言,訓練側對大規模 GPU 叢集的依賴、推理側對長上下文與工具呼叫的支援,以及各家模型在不同評測上的此消彼長,都是後續值得跟蹤的線索。