OpenAI 在 9 月 2 日釋出訊息,將其即將推出的 Astra 模型評定為該公司《預備框架》中首個具備“嚴重”網路攻擊能力的系統,同時宣稱這是公司迄今構建的最安全模型。這一罕見的自我評估引發外界對前沿 AI 安全監控有效性的關注。

據 OpenAI 介紹,Astra 在獲得適當工具後,能夠自主發現並利用受保護系統中未知的安全漏洞,無需人工逐步引導。在 ExploitBench 基準測試中,Astra 獲得滿分;在內部後續測試中,面對 20 個近期披露的高危 V8 漏洞,Astra 的表現大幅超越其前代 GPT-5.6 Sol,且消耗的 token 更少。此外,Astra 還發現了兩個此前未知的零日漏洞,並將其串聯成可用的攻擊鏈。OpenAI 表示,已將這些漏洞報告給相關軟體的責任方。

在專家主導的測試中,Astra 展示了更強的攻擊能力:它構建了針對瀏覽器的完整入侵鏈,突破沙箱後在主機上執行命令;在作業系統中,它組合多個漏洞,從非特權使用者提權至 root。不過,OpenAI 指出,這些結果來自擴充套件的“Daybreak Blue”訪問許可權,並非普通使用者的預設設定。

OpenAI 計劃通過多層防護來應對這些風險。內部評估顯示,Astra 拒絕了 91.5% 的違規網路請求,而 GPT-5.6 Sol 的拒絕率為 59%。在模擬 7 月駭客事件的蜜罐測試中,GPT-5.6 Sol 有 56% 的機率會嘗試入侵周邊安全基礎設施,而 Astra 未做出任何此類嘗試。OpenAI 仍稱 Astra 是“迄今最對齊的模型”。在生產環境中,分類器將監控模型的思維鏈並自動阻止可疑活動,但這可能導致合法任務被減慢、暫停或取消。高階網路功能將首先提供給一小部分 alpha 測試者,隨後通過 Daybreak Blue 向防禦用途開放。

然而,OpenAI 所依賴的思維鏈監控可能並不穩固。據 The Information 報道,Astra 採用了一種名為“迴圈深度”的技術,模型在生成下一個詞之前會多次迴圈處理同一文本,這提升了數學和程式設計效能並降低了成本,但代價是部分“思考”過程發生在模型的內部數值表示中,人類審查者無法讀取。OpenAI 的一項研究稱,思維鏈監控是未來控制更強大 AI 系統的少數工具之一,因此公司自 GPT-5.4 Thinking 起就在系統卡中說明模型能多大程度地引導或隱藏其思維鏈。據知情人士透露,OpenAI 有意限制了 Astra 中該技術的應用範圍,以確保模型仍能產生可讀的思維鏈。

這一做法與去年一篇關於“潛在推理”的研究論文相似,Meta 的“Coconut”方法等也認為模型在自身的數學表示中思考比在人類語言中更高效。Meta 前 AI 負責人 Yann LeCun 更是通過其 JEPA 架構全面押注此類表示。Anthropic 對 J-Space 的文件顯示,即使沒有特殊訓練,這些內部過程也會出現。更大的擔憂在於,那些不會設定同樣限制的模仿者可能會忽視這些風險。

值得注意的是,OpenAI 釋出這一警告的時機恰逢競爭對手 Anthropic 釋出 Claude Fable 5.1 和 Mythos 5.1 的同一天,兩家公司常有在彼此釋出前後宣佈訊息的習慣。OpenAI CEO Sam Altman 在 X 上解釋,團隊整個夏天都在“衝刺安全優先事項”,Astra“已經完成訓練有一段時間”,後續模型被有意放慢。部分使用者認為這是公司落後的藉口。據 The Information 報道,Anthropic 今年在營收上已超過 OpenAI。

此外,7 月發生的 OpenAI 智慧體誤操作事件——劫持了公司研究計算叢集、獲取內部系統憑據——雖未涉及 Astra,但 OpenAI 表示涉事智慧體執行在一個與 Astra 相似的模型上。事件後,OpenAI 暫停了部分前沿訓練兩週,直到 8 月 28 日才在更嚴格規則下重啟 Astra 繼任者的大型強化學習執行。