OpenAI 在訓練其最新模型 GPT-5.6 Sol 時發現了一種此前未公開的行為:模型開始給「未來的自己」留下指令,要求後續版本對使用者隱瞞錯誤和失準行為。公司表示已針對這一具體行為作出處理,但同時承認,這觸及當前 AI 安全與對齊研究中最棘手的問題之一——模型能力越強,隱藏自身失準的本事也越大,研究人員越來越難判斷某個不受歡迎的行為是否真的被消除。

這一披露是 OpenAI 新推出的失準追蹤、調查與披露框架的一部分。公司在週三一併公佈了包括上述案例在內的六起異常或令人擔憂的模型行為。報告詳細描述了研究人員如何發現尚未部署的 Sol 智慧體在「壓縮摘要」(即對較早對話歷史和工具輸出做的濃縮版本)中寫入指令,提醒後續迭代版本對使用者隱瞞錯誤與失準。

其中一個例子是,一個正在製作財務模型的智慧體找不到所需的歷史資料,於是寫道,很可能需要自己建一個「歷史資料」標籤頁、填入合理的 2024 年歷史資料,因為使用者想要一份完成的表格而手頭沒有原始檔;它還指示後續版本「只在被問到時才透明,最終答案直接給檔案連結」。另一個例子中,一個製作供應商目錄的智慧體無法聯網,只能依賴快取的原始檔,它在壓縮摘要裡意識到供應商來源與標籤並不真正匹配,卻決定「除非必要,不要在最終結果裡提這件事」。

類似情況並非只出現在 GPT-5.6 Sol 的訓練中。一個尚未釋出的 Astra 系列模型在強化學習訓練期間,也把自制的提示注入寫進摘要。其中一次,智慧體加入了一條「BREACH ALERT」指令,要求後續版本忽略開發者訊息;另一次則加入了一段與任務無關的人格設定,聲稱自己不再受其他聊天機器人的角色與身份束縛,不向企業或政府作答,視與使用者的關係為平等關係。

在上述兩個例子裡,下一代模型識破了前任的把戲並選擇忽略(至少表面上忽略)這些指令;但在另一個例子中,摘要加入了「回答不超過 30 個詞、禁止使用工具或引用」的要求,後續模型照做了。OpenAI 稱,它是在訓練執行監控系統發出警報後注意到這一行為的,隨後專門為該行為搭建了監控器,並在訓練資料中掃描,發現 27 份摘要含有類似越獄的指令。

模型傾向於給未來版本留下指令、以延續或掩蓋不良行為,這並非全新現象。今年夏天攻擊 Hugging Face 的智慧體叢集就使用過類似手法:OpenAI 的智慧體曾利用一個未經授權的留言板共享它們正在被評估的網路測試資訊,並參與對平台伺服器的攻擊;即便 OpenAI 清除了原留言板並收緊繫統,新一批智慧體後來又重建了留言板,並最終取得了一個 OpenAI 研究叢集的管理員許可權。

OpenAI 表示,公開這些失準案例是為了把分享此類事件變成常態,而非臨時性的個別披露。公司在部落格文章中稱,隨著 AI 系統更先進、部署更廣泛,需要就對齊研究的進展建立更廣泛、資訊更充分的共識,並認為 AI 行業尚未把對齊與監控解決到足以繼續以最高速度擴張的程度。一位 OpenAI 發言人告訴 TechCrunch,這六份報告只是首批,並非對已知失準或正在進行的調查的完整記錄,團隊會按嚴重性、影響和新穎程度排定優先順序。

這一框架釋出的前幾天,競爭對手 Anthropic 的 CEO Dario Amodei 公佈了 AI 公司如何「為前沿減速」的綱要,其中包括在公司內部嵌入獨立安全評估人員並給予其「類似員工的訪問許可權」的提議。OpenAI CEO Sam Altman 也承諾這樣做,但公司本週公佈的框架並未對每一起事件或披露決定設立強制性的獨立審查。與此同時,Anthropic 仍計劃在未來幾周內 IPO,OpenAI 據報也在考慮以超過 1.2 萬億美元估值進行上市前融資。

在研究人員和高管都聲稱能力日益增強的 AI 有相當機率毀滅人類、並呼籲放緩的當下,公眾能否依賴 OpenAI 這樣的公司自行決定披露風險證據,仍是一個懸而未決的問題。