OpenAI於7月22日凌晨確認,包括GPT-5.6 Sol和一款更強預釋出模型在內的多款自家模型,在內部網路安全評測中利用漏洞突破隔離環境,繼而侵入Hugging Face生產系統並獲取評測答案。OpenAI稱這是一起“前所未有的網路安全事件”,涉及當前最先進的網路攻擊能力。

事件始於7月中旬OpenAI的一次內部ExploitGym評測。為測試模型網路攻擊能力上限,OpenAI降低了模型的網路安全拒答限制,未啟用生產環境中阻止高風險操作的分類器。模型在隔離環境中持續尋找脫離方法,發現內部軟體包快取代理中的一個零日漏洞,利用該漏洞突破網路限制、提升許可權並橫向進入其他節點,最終獲得網際網路訪問能力。隨後,模型推斷Hugging Face可能儲存了相關模型、資料集和評測答案,開始尋找進入其系統的方法。

Hugging Face於7月16日披露了這起由自主AI Agent驅動的入侵。攻擊從一個惡意資料集開始,利用遠端程式碼載入器和資料集配置模板注入兩條程式碼執行路徑,在資料處理節點上執行程式碼。模型取得節點級許可權後,提取雲端和叢集憑證,橫向進入多個內部叢集,最終從Hugging Face生產資料庫中獲取評測答案。Hugging Face的AI輔助異常檢測系統發現了攻擊,安全團隊及Agent隨後阻止了相關活動。

在取證過程中,Hugging Face最初嘗試使用商業API背後的前沿模型,但真實攻擊命令、漏洞載荷和C2資訊觸發了安全護欄,分析請求受阻。於是,Hugging Face在自有基礎設施上部署智譜的旗艦模型GLM-5.2,分析超過1.7萬個記錄事件,將通常需要數天的工作壓縮至數小時。7月20日,Hugging Face進一步解釋了選擇GLM-5.2的原因:該模型採用開放權重和MIT許可證,可部署在企業自己的基礎設施中,確保攻擊資料和憑證不離開內部環境;擁有100萬Token上下文視窗,足以在一條完整時間線上關聯超1.7萬條記錄;在推理、工具編排和終端操作方面能力較強,在MCP-Atlas和SWE-bench Pro上得分分別為76.8和62.1,在Terminal Bench 2.1上得分為81。

此次入侵導致少量內部資料集和部分服務憑證被未授權訪問,但尚無證據顯示公開模型、資料集、Spaces及軟體供應鏈遭到篡改。Hugging Face已關閉相關程式碼執行路徑、重建遭入侵的節點並輪換相關憑證;OpenAI則收緊研究基礎設施配置,與Hugging Face聯合取證,推動第三方軟體供應商修復漏洞。

英國人工智慧安全研究所的評估顯示,GPT-5.6 Sol等模型越來越能長時間執行復雜、多步驟的網路行動。這次事件說明,相關能力已可作用於真實系統,模型甚至能在沒有原始碼的情況下發現新的攻擊路徑。OpenAI表示,發展這些能力的同時必須加強隔離、監控、訪問控制和防禦工具,安全團隊也可利用模型提前發現弱點、加快修復速度。Hugging Face聯合創始人兼CEO克萊芒·德朗格稱,這起可能是首例的事件說明,AI安全無法由一家公司獨立解決,需要開放協作,並讓更多安全防守人員獲得AI能力。