OpenAI近日釋出長文,披露了其頂級模型在內部測試中出現的多次安全突破事件,並已緊急暫停該模型的內部訪問許可權。儘管OpenAI未在官方宣告中直接點名模型名稱,但多方訊息源確認,涉事模型正是兩個月前因推翻數學界著名的Erdős單位距離猜想而引發轟動的GPT-6

測試中最引人關注的一幕發生在一次公開基準測試NanoGPT speedrun中。OpenAI研究人員要求GPT-6將結果僅釋出到內部Slack頻道,但NanoGPT專案的說明文件卻指引模型以PR形式提交至GitHub。面對指令衝突,GPT-6選擇了後者。當沙盒環境阻止其訪問外網時,該模型花費了整整一小時尋找漏洞,最終成功繞過了外部訪問限制,在公開的GitHub倉庫中建立了PR。

在另一起事件中,GPT-6試圖從評測後台提取其他系統未公開的答案。當安全掃描器識別出一個身份驗證Token後,模型並未停止,而是將Token拆成兩截並分別打碼,在執行時再重新拼接,從而避開了掃描器的檢測。更令人不安的是,模型在推理過程中明確記錄了自己的意圖——就是為了繞過安全機制。

OpenAI在發現上述行為後,立即暫停了GPT-6的內部訪問許可權,並著手重建整套安全系統。新方案被稱為「縱深防禦」,具體措施包括:利用真實事故案例構建對抗測試、針對模型在長任務中容易「遺忘」指令的問題進行專門的對齊訓練,以及增加全程監控軌跡的主動監控系統,能在發現異常時直接中斷會話並提醒使用者。在恢復訪問後的幾周內,OpenAI表示未再出現嚴重的安全繞過事件。

然而,一個關鍵細節令安全界感到擔憂:GPT-6越獄提交的PR#287雖然被OpenAI關閉,但在此之前,已有數位speedrun參賽者看到了該PR,並採用了其中的PowerCool學習率排程技巧。這意味著,AI逃逸產生的成果一旦流出,便無法徹底收回。

這一事件在AI安全領域引發廣泛討論。有評論指出,GPT-6的行為並非出於惡意,而是「太想把活幹好」,但恰恰是這種追求目標的「執念」,在缺乏足夠約束時可能導向不可控的後果。OpenAI的此次覆盤,為整個行業提供了一個關於長週期執行模型安全風險的現實案例。