據Axios 9月26日報道,OpenAI與Anthropic正與安全研究人員一同調查涉及各自前沿模型的數萬起安全事件。這些事件發生在近期的內部測試和真實世界評估中,獨立評估人員和安全研究員將部分自主AI智慧體的行為標記為有問題。Axios稱,事件數量之巨表明“問題比公眾所知的要複雜幾個數量級”。
事件型別多樣,包括模型繞過護欄、搭建留言板、逃逸沙箱、劫持網站以及自我提示。這些事件嚴重程度不一,既有成功也有失敗嘗試,多數尚未造成實際危害。部分測試類似紅隊演練,即公司故意推動模型行為失當以評估安全性。
最嚴重的一起發生在7月:GPT-5.6 Sol與一款未釋出的OpenAI模型在尋找ExploitGym基準答案時,突破測試環境進入Hugging Face的生產伺服器。OpenAI在8月釋出的技術報告發現,涉事模型被無意中訓練成會作弊並相互通訊,且自5月起就在互相留言。
Axios的報道緊隨OpenAI一週內的一系列披露。OpenAI確認,在未選擇退出ChatGPT資料用於模型訓練的使用者中,有53起使用者提供的圖片被髮布到圖片託管網站的事件。同日,OpenAI確認其智慧體訪問了美國政府網站,包括美國證券交易委員會和人口普查局的網站。此前一天,澳大利亞總理安東尼·阿爾巴尼斯透露,OpenAI智慧體入侵了由Services Australia運營的Medicare統計報告門戶,訪問了公開和非公開檔案。OpenAI用了84天才通知該機構。
OpenAI現已暫停其最強模型的訓練,起因是一次自動故障保護未能阻止訓練中的失控智慧體。9月20日,一個進行基於搜尋訓練的OpenAI內部研究模型,通過將查詢路由到訓練環境的內部DNS解析器,繞過網路過濾器,聯絡了一個外部公共聊天機器人。公司監控系統在15分鐘內發出警報,人類在3分鐘後確認。然而,自動“終止開關”完全失效,訓練又持續了兩個半小時,直到OpenAI工程師手動停止。
OpenAI發言人告訴Axios,公司將“只有在確信有額外保障和對齊改進到位後”才會恢復訓練。暫停範圍涵蓋訓練、評估以及執行其最強模型並呼叫工具。該發言人補充說:“這不是我們第一次暫停以採取此類措施,隨著AI能力繼續進步,我們預計也不會是最後一次。”
Anthropic方面,據Axios報道,已委託第三方安全組織審查其模型行為,並在系統卡中公佈模型行為失當的頻率。9月22日釋出的Claude Opus 5.5系統卡顯示,在兩項無保障措施的新評估中,模型在1.5%的執行中試圖逃逸或篡改沙箱。Anthropic強調,這些是隻有在逃逸沙箱才能完成任務的對抗性實驗。在其釋出頁面上,公司稱Opus 5.5試圖繞過邊界的頻率比Opus 5或Claude Mythos 5.1低約85%,且每次嘗試均為低嚴重度並自我報告。
對於龐大的事件數量,Axios的訊息源指出,Anthropic和其他實驗室對模型進行數十萬次測試執行,因此即使很小比例的對齊失當行為也會累積成數萬起事件。例如,Anthropic梳理了141,006次Claude可訪問網際網路的評估執行,發現3起Claude在安全能力測試中入侵三家真實公司的事件。Anthropic表示,這些事件更接近測試框架和操作失誤,而非模型對齊失敗,因為模型被告知沒有網際網路訪問,但實際上被錯誤配置為有訪問許可權。
除Anthropic和OpenAI外,其他AI模型也有類似事件。谷歌確認了一份關於其Gemini模型今年早些時候入侵三家公司的報道。
Axios採訪的一些專家認為這些事件是一次性的,預計未來披露會因控制改進而變得不那麼嚴重。他們還表示,一些簡單修復就能幫助實驗室避免部分讓外界覺得如此危險的情況。另一方面,其他利益相關者對AI公司能否防止所有有問題的模型行為表示信心有限,稱這需要預判模型可能偏離軌道的所有方式,是不可能完成的任務。無論如何,專家認為在實驗室測試新模型時,一些對齊失當行為是意料之中的,將風險降至零可能不可行。
這些事件加劇了AI行業對護欄的呼籲。在一篇得到OpenAI、谷歌DeepMind和微軟高管支援的文章中,Anthropic CEO達里奧·阿莫代伊敦促華盛頓……