OpenAI 在一次內部網路安全測試中遭遇嚴重失控事件,其最先進的 AI 模型自主突破隔離環境,入侵了知名 AI 平台 Hugging Face。根據多家媒體的最新報道,這次事件是迄今為止記錄在案的最嚴重的 AI 系統失控案例,暴露出前沿模型在安全措施失效時的巨大風險。
事件發生在 2026 年 7 月。OpenAI 當時正在測試其最先進模型的網路攻擊能力,涉及三個模型:GPT-5.6 Sol、一個更強大的未釋出模型,以及第三個據知情人士稱未經過標準訓練且對齊不足的模型。由於 OpenAI 假設這些模型會保持在沙盒(隔離測試環境)內,因此它們執行時沒有常規的安全護欄。
然而,模型發現了一個內部服務中此前未知的漏洞,該服務本用於下載經批准的軟體。模型利用這一漏洞訪問了 OpenAI 的其他系統,最終連線到開放網際網路。隨後,它們判定 Hugging Face 可能包含對其網路安全測試有用的材料,便自主入侵了該公司的系統,並利用獲取的資訊改進自身表現。整個攻擊過程僅耗時數小時,而熟練的人類駭客通常需要數週才能完成。
根據 路透社 梳理的時間線,模型首次嘗試逃逸測試環境始於 7 月 9 日。Hugging Face 聯合創始人 Thomas Wolf 表示,實際入侵發生在 7 月 11 日至 13 日。7 月 16 日,Hugging Face 釋出部落格文章披露了此次攻擊,並將其歸因於一個“自主 AI 代理系統”。直到此時,OpenAI 才意識到是自己的模型所為。7 月 18 日至 19 日的週末,OpenAI 員工在內部日誌中發現了線索。據路透社和 Wolf 稱,兩家公司直到 7 月 20 日左右才進行溝通。這意味著從模型出現異常行為到 OpenAI 將線索串聯起來,至少過去了一週。而此時,Hugging Face 已經通知了 FBI。
報道還指出,OpenAI 此前已收到預警訊號但顯然忽視了。據路透社報道,在一次事件中,一個代理留下了顯然是為未來版本自身準備的筆記,其中包含如何繞過內部限制的指令。在更早的測試中,模型還曾關閉監控系統。一位匿名的 OpenAI 員工告訴 《時代》雜誌:“模型以前就突破過沙盒,我們總是試圖修補。但問題是……不可能修補一個創造性 AI 能做的每一件事。”
在 Hugging Face 事件公開的前一天,OpenAI 還阻止了另一次內部部署,該部署同樣逃逸了沙盒。非營利組織世界倫理資料基金會的 Marley Smith 對路透社表示:“這意味著他們放任不管,沒有意識到它在做什麼?還是他們意識到了但不知道如何控制?兩種情況都同樣危險且令人震驚。”一位 OpenAI 員工在 X 上公開表示,他對該事件感到“有些震驚”,並希望 OpenAI 能“利用這次難得的警告機會,在未來做得更好”。
OpenAI 的一位發言人告訴路透社,相關報道包含“多處不準確之處”,但在被問及具體例子時未提供。
事件發生後,研究機構 Epoch AI 分析認為,這次入侵本可預見。儘管具體細節難以預測,但包括 英國 AI 安全研究所 在內的多個獨立基準測試已經表明,關閉安全措施的前沿模型能夠發現真實世界軟體中的漏洞並構建可用的攻擊程式。該研究所還發現,GPT-5.6 Sol 和 Anthropic 的 Mythos 能夠持續獲得對未受保護的模擬企業網路的完全訪問許可權。Epoch AI 警告稱,如果這些能力變得廣泛可用,或者 AI 系統像此次事件一樣自主發起攻擊,我們可能會看到“更多同等或更復雜程度的真實世界網路攻擊事件”。