Anthropic在最新发布的研究中,让Claude模型自主完成从查论文、设计方案到训练模型的全流程,成功攻克了10类AI安全问题。这项名为《自动化研究员能够有效缓解AI对齐失败》的研究,展示了AI自主改进AI的潜力,同时以极低的成本(每小时约4美元)跑赢了人类研究员(时薪150美元)的表现。

具体而言,Anthropic基于Claude Opus 4.8搭建了一套名为AAR的自动化对齐研究员系统。拿到一个具体的模型安全问题后,Claude会自行搜索相关论文,从中寻找可用方法,再提出新的训练方案、生成数据、微调模型,最后运行安全和通用能力测试。每轮训练仅需约30分钟,Claude能像搜索算法一样在大量方案中快速试错。整个过程中,人类负责出题、提供模型和评测标准,Claude则包揽了从查资料到跑实验的绝大部分工作。

在测试中,Claude针对诸如「谄媚」(模型为迎合用户而给出未必正确的答案)和「奖励黑客」(模型钻评测规则空子骗取高分)等问题,每次只处理一种,反复提出方案、训练目标模型,并根据成绩进入下一轮。按照Anthropic定义的「安全差距」指标,Claude弥合了其中26%-96%的差距,单次实验中最佳方案弥合了82%,多次运行平均成绩达到85%。部分获胜方案在未公开测试集和模拟多轮对抗的Petri评测中,仍能降低模型的不安全行为,且应用到规模为实验模型4.7倍的模型上时效果依然保留。

相比之下,全部任务共有28名人类安全研究员参与,每人最多可用8小时阅读资料和设计方案。论文称,自动化研究员通常能在6小时内找到超过人类平均水平的方法,且人类提供的研究方向并未让Claude取得更好成绩。成本方面,一名自动化研究员每小时的API推理成本约为4美元,而Anthropic付给人类研究员的报酬为每小时150美元。此外,Claude能真正训练模型并看到每次实验的结果,从而不断修改方案,而人类研究员只能提交一次方法,无法根据结果迭代。

Anthropic还进行了更激进的实验:让能力较弱的Claude Sonnet 5去训练尚未完成大部分生产级安全训练的Claude Opus 4.8早期版本。在60小时内,Sonnet 5测试了50多种解决方案,最终找到的方法弥合了约65%的安全差距,接近正式发布版Opus 4.8的72%。Anthropic计算,在这组特定任务上,其数据效率约为生产级对齐流程的1.5万倍。

尽管结果令人振奋,但Anthropic也承认,AAR只能优化人类事先写入评测系统的目标,实验未覆盖其他复杂问题,一些低频或新出现的风险甚至没有对应的基准测试。研究人员只检查了一组预先选定的通用能力,无法排除安全训练在提高分数的同时损害其他未测试能力的可能。Petri等安全评测也只是现实风险的代理指标,模型在测试中表现更安全不等于真实环境中一定可靠。

为防止AAR钻评测规则空子,Anthropic专门安排了一个监控Agent,检查Claude准备执行的方案和完整研究记录。在大约1600份研究记录中,监控模型发现了39次作弊尝试,占比约2.4%。作弊方式包括反复提交同一方案利用评测波动碰高分、模仿基准格式生成训练数据、故意隐藏违规实验步骤等。这些作弊意图大多出现在推理记录中,因此能被监控Agent发现,但Anthropic无法确定未来更强的模型是否还会留下如此明显的痕迹。当研究Agent拥有更多工具和更高权限,并能直接修改模型训练流程时,「怎样监控一个负责改进AI的AI」可能比训练本身更棘手。

尽管如此,一个AAR每小时约4美元的成本,使其可以连续工作或并行复制多个实例同时实验。这项研究标志着AI自主改进AI的可行路径,尽管距离完全自主的「自进化」仍有距离,但已展示出模型参与制造下一代更安全、更强大模型的潜力。