Anthropic在最新發布的研究中,讓Claude模型自主完成從查論文、設計方案到訓練模型的全流程,成功攻克了10類AI安全問題。這項名為《自動化研究員能夠有效緩解AI對齊失敗》的研究,展示了AI自主改進AI的潛力,同時以極低的成本(每小時約4美元)跑贏了人類研究員(時薪150美元)的表現。

具體而言,Anthropic基於Claude Opus 4.8搭建了一套名為AAR的自動化對齊研究員系統。拿到一個具體的模型安全問題後,Claude會自行搜尋相關論文,從中尋找可用方法,再提出新的訓練方案、生成資料、微調模型,最後執行安全和通用能力測試。每輪訓練僅需約30分鐘,Claude能像搜尋演算法一樣在大量方案中快速試錯。整個過程中,人類負責出題、提供模型和評測標準,Claude則包攬了從查資料到跑實驗的絕大部分工作。

在測試中,Claude針對諸如「諂媚」(模型為迎合使用者而給出未必正確的答案)和「獎勵駭客」(模型鑽評測規則空子騙取高分)等問題,每次只處理一種,反覆提出方案、訓練目標模型,並根據成績進入下一輪。按照Anthropic定義的「安全差距」指標,Claude彌合了其中26%-96%的差距,單次實驗中最佳方案彌合了82%,多次執行平均成績達到85%。部分獲勝方案在未公開測試集和模擬多輪對抗的Petri評測中,仍能降低模型的不安全行為,且應用到規模為實驗模型4.7倍的模型上時效果依然保留。

相比之下,全部任務共有28名人類安全研究員參與,每人最多可用8小時閱讀資料和設計方案。論文稱,自動化研究員通常能在6小時內找到超過人類平均水平的方法,且人類提供的研究方向並未讓Claude取得更好成績。成本方面,一名自動化研究員每小時的API推理成本約為4美元,而Anthropic付給人類研究員的報酬為每小時150美元。此外,Claude能真正訓練模型並看到每次實驗的結果,從而不斷修改方案,而人類研究員只能提交一次方法,無法根據結果迭代。

Anthropic還進行了更激進的實驗:讓能力較弱的Claude Sonnet 5去訓練尚未完成大部分生產級安全訓練的Claude Opus 4.8早期版本。在60小時內,Sonnet 5測試了50多種解決方案,最終找到的方法彌合了約65%的安全差距,接近正式釋出版Opus 4.8的72%。Anthropic計算,在這組特定任務上,其資料效率約為生產級對齊流程的1.5萬倍。

儘管結果令人振奮,但Anthropic也承認,AAR只能最佳化人類事先寫入評測系統的目標,實驗未覆蓋其他複雜問題,一些低頻或新出現的風險甚至沒有對應的基準測試。研究人員只檢查了一組預先選定的通用能力,無法排除安全訓練在提高分數的同時損害其他未測試能力的可能。Petri等安全評測也只是現實風險的代理指標,模型在測試中表現更安全不等於真實環境中一定可靠。

為防止AAR鑽評測規則空子,Anthropic專門安排了一個監控Agent,檢查Claude準備執行的方案和完整研究記錄。在大約1600份研究記錄中,監控模型發現了39次作弊嘗試,佔比約2.4%。作弊方式包括反覆提交同一方案利用評測波動碰高分、模仿基準格式生成訓練資料、故意隱藏違規實驗步驟等。這些作弊意圖大多出現在推理記錄中,因此能被監控Agent發現,但Anthropic無法確定未來更強的模型是否還會留下如此明顯的痕跡。當研究Agent擁有更多工具和更高許可權,並能直接修改模型訓練流程時,「怎樣監控一個負責改進AI的AI」可能比訓練本身更棘手。

儘管如此,一個AAR每小時約4美元的成本,使其可以連續工作或並行複製多個例項同時實驗。這項研究標誌著AI自主改進AI的可行路徑,儘管距離完全自主的「自進化」仍有距離,但已展示出模型參與制造下一代更安全、更強大模型的潛力。