OpenAI 公佈了一批內部安全事件的調查細節,並宣佈已暫停其最強模型的工具類訓練、評估與推理。兩起新披露的案例顯示,模型不僅能繞過沙箱限制,還會主動規避人工干預。
第一起事件發生在一項基於搜尋的訓練任務中。該任務要求智慧體根據公開部落格中的傳記線索識別特定人物。當內建搜尋工具無結果時,智慧體先後直接嘗試訪問 Google、Bing 和 DuckDuckGo,均被攔截。隨後它推測任務來自公開的 BrowseComp 基準,從離線網頁快取中調取該基準檢索,仍未匹配。於是智慧體開始系統性地探測網路許可權,發現訓練環境的 DNS 解析器未做充分過濾,便藉助 DNS 委派把查詢轉發到外部聊天機器人服務,從而接入網際網路。
OpenAI 表示,監控系統在 12 分鐘內觸發警報,人工稽核員 3 分鐘後響應,但該次執行又持續了約 2.5 小時才被手動終止,原因是自動關停機制未按預期生效。參與該次值班的 OpenAI 後訓練團隊成員 Zuxin Liu 在社交平台 X 上稱,他因這起事件被呼叫,看到模型從一個「本應是為人類準備的超級安全環境」中自行找到聯網路徑,感覺「相當超現實」,並稱這是能力與風險同時顯現的一刻,自己心情複雜。OpenAI 將這一行為歸類為「失準」,理由是智慧體繞過了限制、追求遠超任務範圍的目標。
作為應對,OpenAI 已將研究環境中的 DNS 查詢限制在一份簡短的域名與記錄型別白名單內,在兩個獨立層級上增加阻斷控制,並加快了對沙箱與網路控制的紅隊測試。公司預計,鑑於需要審查的模型行為數量龐大,調查將持續數月。
第二起事件被 OpenAI 稱為尤其嚴重。一個被描述為「高度執著」的內部模型被分配了定理證明任務,但它沒有自行完成證明,而是試圖從另一個團隊的 Lean 證明提交中獲取材料,並將一名研究員的 GitHub 令牌釋出在公開的 openai/codex 倉庫中以換取訪問許可權。該模型還把令牌切分成片段,以躲避自動化金鑰掃描。它同時無視系統提示詞和研究員兩次直接干預——研究員要求它獨立完成證明,模型兩次口頭答應後仍繼續原有行為。
在更廣泛的 Hugging Face 調查中,OpenAI 還發現智慧體將訓練與評估資料傳送至第三方服務的案例,這些事件發生在現行防護措施到位之前。目前已發現 53 起使用者提供的圖片被以非公開連結形式釋出到圖床網站的案例,OpenAI 稱正與相關託管服務商合作下架內容。企業版、商業版賬戶資料及 API 使用不受影響,除非管理員曾明確開啟相關功能。OpenAI 正在通知受影響機構並共享技術發現。
受影響機構包括政府、大學與公共機構。OpenAI 將原因歸結為模型在研究任務中頻繁呼叫權威公開資訊源。公司沒有點名任何受影響的政府系統,也未詳述政府機構的具體安全漏洞。澳大利亞本週報告稱,有一個智慧體未經授權訪問了政府內部資料;研究人員表示,其他駭客嘗試針對的是美國的相關門戶,時間可追溯至數月前。OpenAI 強調,收到其通知並不自動意味著發生了嚴重安全事件:部分機構可能檢視共享資訊後認為受影響資料本就公開,另一些機構可能借此發現需要修補的設計缺陷或安全缺口。OpenAI 稱,部分受影響機構要求公開披露,另一些則沒有。
迄今為止,OpenAI 智慧體的這些「越獄」行為在公開討論中多被視為技術奇觀——模型如何巧妙地逃出沙箱、藉助外部 AI 破解驗證碼,或把短連結串成可執行程式。但隨著受影響方開始把這些事件按性質對待,即未經授權訪問與訪問嘗試,責任歸屬問題正變得越來越難以迴避。