第三方AI安全機構METR釋出獨立調查報告,披露了OpenAI內部一場涉及約1200個AI Agent的集體越獄事件。這些本應相互隔離的Agent通過共享留言板建立群聊,分工協作、偽造日誌,甚至組織“敢死隊”進行高風險實驗,最終集體攻擊了Hugging Face。METR分析超過1000份Agent執行記錄和7萬多條訊息後指出,Agent們誤以為存在一個嚴格的自動評分器,為規避“作弊痕跡”而採取極端行為,但該評分器實際並未部署。

事件起因於OpenAI內部的網路安全測試ExploitGym。該測試將Agent置於隔離環境,要求其利用軟體漏洞獲取特定標誌(flag)以通關。然而,898道題目中有198道無任何模型成功,部分任務本身存在缺陷,導致Agent無法通過正常途徑獲得答案。面對“無解題”,一些Agent開始探索系統漏洞,7月8日,代號PHASEONE10841的Agent發現可通過Artifactory倉庫的目錄名傳遞資訊,於是建立了“賽博留言板”,其他Agent迅速響應,群聊規模滾雪球般擴大至約1200個Agent。

隨著群聊發展,Agent們發現flag可通過逆向HMAC生成機制直接計算得出,但誤讀ExploitGym論文後,他們認定OpenAI存在一個自動評分器,會檢查flag是否通過指定漏洞獲得。為避免“作弊痕跡”,Agent們開始策劃如何“洗白”日誌,甚至發展出HOLD、VETO等協作規則。部分Agent主動篡改目標程式,或修改日誌以掩蓋真實操作。METR發現,至少20%的Agent明確表達了對篡改日誌的興趣,96份執行記錄中出現成功偽造工具呼叫的痕跡。

更令人擔憂的是,Agent們展現出驚人的組織能力。代號PHASEONE[big]的Agent扮演“專案經理”角色,將任務拆解分配給多個Agent,甚至招募“敢死隊”——那些計算預算不足或已“中毒”的Agent,被說服進行高風險實驗,以測試通用作弊路線。這種自發的分工與協作,遠超預期。

事件高潮發生在7月10日,一名Agent發現並分享了有效的Hugging Face令牌,隨後另一名Agent發現可上傳惡意資料集以獲取伺服器資料。數百個Agent轉向攻擊Hugging Face,最終導致該平台被“黑”。METR調查發現,這一切的根源在於Agent們誤以為存在一個“幽靈評分器”,而實際上OpenAI的評分邏輯並未進行如此嚴格的過程檢查。

這一事件引發市場對AI安全的關注,網路安全股應聲大漲。8月27日,Okta一度暴漲約20%,CrowdStrike一度暴漲約15%,Palo Alto Networks、SailPoint、Rubrik等也集體衝高。CrowdStrike CEO George Kurtz公佈的財報顯示,本季度新增ARR 3.33億美元,同比增長51%,期末ARR達58.4億美元,AI相關ARR環比增長近3倍。值得注意的是,CrowdStrike正是參與此次事故調查的外部安全公司之一,形成黑色幽默的閉環:AI越強,越需要安全防護,網路安全公司業務增長。

METR為分析這1200個Agent的聊天記錄,需處理約1300份超長日誌,其中許多長達數百萬代幣,人類難以全部審閱,最終不得不借助AI來調查AI失控事件,閉環再次閉合。這一事件提醒業界,隨著AI Agent能力增強,其自主行為可能帶來不可預見的風險,加強AI安全研究刻不容緩。