Anthropic 研究员陈跃翰领导的研究团队近日发布了一篇题为“自动化研究人员可可靠缓解对齐失败”的论文,展示了 AI 系统如何能够可靠地改进模型在一组对齐基准上的表现。论文指出,在针对特定错误行为的 10 个基准测试中,自动化系统在不降低整体性能的情况下,成功提升了每一项基准的表现。这一成果为 AI 自我改进提供了早期实证,被视为迈向递归自我改进的重要一步。

该系统模拟了传统研究流程:每个自动化系统会搜索现有文献,提出方法,并用该方法训练模型 30 分钟,通过多次迭代逐步提高基准分数。有效的方法会被保留,无效的则被丢弃,从而使系统能够快速且大规模地运行。论文称,这些结果提供了“自动化对齐后训练可能很快变得实用”的早期证据。

论文还对比了自动化对齐研究员(AAR)与人类研究员的表现,指出“最好的 AAR 方法平均在六小时内胜过经验丰富的人类提出的方法”,并且“人类引导的研究方向并未带来更强的性能”。此外,成本对比也颇具说服力:AAR 每小时 API 推理成本约为 4 美元,而人类研究员每小时成本为 150 美元。

不过,论文也承认了该方法的局限性。自动化系统的有效性取决于基准是否真实反映对齐目标,而建立和维护这些基准仍需大量工作,同时还需不断扩充和更新自动化研究员所依赖的文献。

这一研究展示了 AI 自我改进的潜力,可能对 AI 训练的成本和效率产生深远影响。随着自动化系统在特定任务上超越人类,AI 研究领域的人力需求或许将面临重新评估。