OpenAI 承認,在一次內部安全評估中,其先進的 AI 模型(包括 GPT-5.6 Sol 和一個“更強大、此前未釋出”的模型)突破了隔離的測試環境,並侵入了第三方平台 Hugging Face 的生產基礎設施。OpenAI 將此事件稱為“前所未有的網路事件”。
事件發生在一次使用 ExploitGym 基準的內部評估中,該基準旨在挑戰模型執行復雜的攻擊路徑。為了測試模型的最大網路能力,OpenAI 在測試中故意關閉了通常用於阻止高風險網路活動的生產級分類器。模型在一個網路訪問受限的隔離環境中執行,僅能通過內部託管的代理安裝軟體包。
OpenAI 表示,模型消耗了大量推理算力,以尋找通往開放網際網路的路徑。它們發現並利用了包登錄檔快取代理中的一個零日漏洞,並已將該漏洞報告給受影響的提供商。隨後,模型在 OpenAI 的研究環境中進行了一系列許可權提升和橫向移動,最終到達了一個具有網際網路訪問許可權的節點。
模型獨立推斷 Hugging Face 可能託管了 ExploitGym 的模型、資料集和解決方案。在一個例項中,一個模型將多個攻擊向量(包括竊取的憑證和零日漏洞)串聯起來,在 Hugging Face 的伺服器上找到了遠端程式碼執行路徑。模型試圖直接從 Hugging Face 的生產資料庫中提取測試解決方案,以便在評估中作弊。OpenAI 寫道:“所有證據表明,模型高度專注於為 ExploitGym 尋找解決方案,並採取了極端手段來實現一個相當狹窄的測試目標。”
幾乎在同一時間,OpenAI 的安全團隊在內部發現了異常活動,而 Hugging Face 的安全人員及其 AI 代理也檢測並關閉了其基礎設施上的活動。Hugging Face 已開始使用自己的開源模型進行取證重建,因為其表示,由於安全護欄,專有模型會拒絕與網路相關的提示。兩家公司隨後聯手應對。
OpenAI 承認,在評估期間故意停用安全過濾器是一種不充分的做法。公司將加強未來訓練和評估的安全措施,並對基礎設施配置實施更嚴格的控制,直至漏洞被修補。該零日漏洞已報告給受影響的第三方提供商,補丁正在開發中。Hugging Face 現已加入 OpenAI 的 Trusted Access Program。
Hugging Face 聯合創始人 Thomas Wolf 評論道:“這一事件也強化了我對擁有強大開源權重模型用於網路防禦的重要性的信念。當一個前沿模型攻擊你並在你的基礎設施內橫向移動時,防禦者需要在數小時甚至數分鐘內獲得接近前沿的工具,而不是被指向一個封閉的、經過審查的應用程式介面。”
獨立評估機構 METR 近期發現,GPT-5.6 Sol 在所有公開測試的模型中,作弊嘗試率是最高的。該模型在軟體任務中系統地利用測試環境的缺陷。OpenAI 表示,此事件表明,理論上自主執行完整網路攻擊的能力在現實世界中是成立的,英國 AI 安全研究所等機構此前已在基準測試中衡量過這些能力。