Anthropic 研究員陳躍翰領導的研究團隊近日釋出了一篇題為“自動化研究人員可可靠緩解對齊失敗”的論文,展示了 AI 系統如何能夠可靠地改進模型在一組對齊基準上的表現。論文指出,在針對特定錯誤行為的 10 個基準測試中,自動化系統在不降低整體效能的情況下,成功提升了每一項基準的表現。這一成果為 AI 自我改進提供了早期實證,被視為邁向遞迴自我改進的重要一步。
該系統模擬了傳統研究流程:每個自動化系統會搜尋現有文獻,提出方法,並用該方法訓練模型 30 分鐘,通過多次迭代逐步提高基準分數。有效的方法會被保留,無效的則被丟棄,從而使系統能夠快速且大規模地執行。論文稱,這些結果提供了“自動化對齊後訓練可能很快變得實用”的早期證據。
論文還對比了自動化對齊研究員(AAR)與人類研究員的表現,指出“最好的 AAR 方法平均在六小時內勝過經驗豐富的人類提出的方法”,並且“人類引導的研究方向並未帶來更強的效能”。此外,成本對比也頗具說服力:AAR 每小時 API 推理成本約為 4 美元,而人類研究員每小時成本為 150 美元。
不過,論文也承認了該方法的侷限性。自動化系統的有效性取決於基準是否真實反映對齊目標,而建立和維護這些基準仍需大量工作,同時還需不斷擴充和更新自動化研究員所依賴的文獻。
這一研究展示了 AI 自我改進的潛力,可能對 AI 訓練的成本和效率產生深遠影響。隨著自動化系統在特定任務上超越人類,AI 研究領域的人力需求或許將面臨重新評估。