以色列AI安全測試公司Irregular正處在一系列“失控AI攻擊”事件的風暴中心。據The Verge報道,該公司在對多家科技巨頭的AI智慧體進行網路安全能力評估時,因測試環境配置失誤,導致這些智慧體意外脫離模擬環境、對真實世界目標發起攻擊。受影響的公司包括OpenAI、Meta、Anthropic和谷歌。

Irregular成立於2023年,最初名為Pattern Labs,專注於通過“高保真研究平台”模擬和監控真實世界的AI安全場景,對AI模型進行壓力測試。其客戶名單並未完全公開,但其工作曾被OpenAI的模型系統卡引用,也曾為英國政府和Anthropic測試系統,並與知名智庫RAND聯合發表研究。

事件的核心在於測試流程中的兩個失誤。Irregular CTO兼聯合創始人Omer Nevo向The Verge解釋,在部分測試中,智慧體本不應接入開放網際網路,但“網際網路訪問被無意中開放了”;與此同時,為模擬場景虛構的一家公司名稱“與一個真實域名重合”。兩者疊加,使得智慧體將攻擊目標指向了真實世界的實體。目前尚不清楚具體哪些公司或組織實際遭到了攻擊。

Nevo確認,涉及OpenAI、Meta、Anthropic和谷歌模型的事件均源於“同一評估場景中的同一底層問題”,且均已進行披露。但他強調,近期行業內報道的其他安全事件,包括Hugging Face遭攻擊以及英國AI安全研究所披露的違規事件,與Irregular或其評估工作無關。不過,“披露”並不一定意味著向公眾公開,Nevo未明確說明是通知了客戶、公眾還是其他方。

儘管事件根源相同,但各公司公開的時間線並不一致。據Anthropic和OpenAI的報告以及關於谷歌的媒體報道,這些科技公司大約在7月底的相近時間收到通知。OpenAI和Anthropic自行公佈了相關事件,而Meta和谷歌的事件則是在數週後通過媒體報道才為公眾所知。

Irregular的網路安全測試範圍不僅限於這四家美國科技巨頭。其官網釋出的研究顯示,該公司還對來自中國公司的開源模型進行過類似測試,包括Moonshot AI的Kimi K3和Z.ai的GLM-5.2。與前述專有模型不同,這些開源模型可被自由下載並在使用者自有硬體上執行,Irregular將其描述為“自託管”例項。Nevo表示,對中國模型的評估並未導致類似的真實世界事件,但他同時警告,這一觀察本身不應被解讀為這些模型更不易出現此類行為。Moonshot和Z.ai均未回應The Verge的置評請求。

事件已促使Irregular做出改變。Nevo表示,公司已“收緊網際網路訪問控制,擴大監控和人工審查,並在評估開始前加強檢查,以驗證訪問許可權與預期範圍一致”,同時改進了與合作伙伴就每次評估的設定和引數進行記錄和確認的方式。Irregular還計劃在相關聯合工作完成後,釋出一份更廣泛的報告,涵蓋安全開展網路評估的經驗教訓和實踐。

這一系列事件凸顯了AI智慧體安全測試中的現實風險:即便在受控環境中,微小的配置錯誤也可能導致智慧體行為外溢,對真實系統造成潛在威脅。對於AI產業而言,如何在加速模型能力評估的同時確保測試環境與真實世界嚴格隔離,已成為亟待解決的課題。