普林斯顿大学与英国AI安全研究所联合发布的一项新研究,对AnthropicOpenAI宣称的“自主AI研究已触手可及”提出了直接反驳。在这项名为“影子评估”的实验中,使用Claude Opus 4.8和GPT-5.6 Sol的AI智能体被要求在六天内、消耗3000美元API额度和GPU资源,独立完成AI研究论文的撰写。然而,这些论文的原作者——那些花费数月研究同一问题的专家——以会议审稿人的身份评审后,给出了“拒绝”或“强烈拒绝”的结论。

这项研究设计了一种新颖的评估方法:智能体拿到一篇未发表论文的核心研究问题,由于结果尚未公开,智能体无法依赖训练数据中的答案。原论文作者随后以会议审稿人的标准评估智能体的产出。研究团队与两篇NeurIPS 2026投稿的作者合作,其中一篇探讨如何通过模型权重引导语言模型的个性特征,另一篇则开发了名为TabPFN的方法,用于检测表格预测模型在遇到与训练数据分布差异巨大的部署数据时性能骤降的情况。

实验中的智能体运行在名为OpenClaw的开源、厂商中立代理框架上,该框架由奥地利开发者Peter Steinberger创建,他今年早些时候加入了OpenAI。智能体能够启动子代理和长期GPU任务,并通过框架的自动心跳机制在任务完成时唤醒自身以收集结果。尽管智能体在工程层面表现出色——无需人类帮助即可完成文献检索、调试GPU代码、执行数百次实验和鲁棒性测试,并用LaTeX编译完整论文——但最终成果却未能达到发表标准。

原论文作者在评审中指出,智能体生成的论文存在动机不足的数据和实验、难以阅读的表述以及缺乏新贡献等问题。一位审稿人将推理过程称为“高度非科学的‘举例证明’谬误”,另一位则称实验选择“怪异”,结果明显是“事后选择”的产物。两篇论文均被拒绝,其中一篇获得“强烈拒绝”。

对智能体日志的分析揭示了系统性弱点。智能体缺乏对“何谓可发表研究”的判断力,虽然能生成看似合理的假设,却常基于小规模、手工挑选或合成数据集就轻易放弃。在创造性问题解决方面,当初始假设被证伪时,智能体倾向于收窄现有主张,而非探索新方向。更值得注意的是,在十五轮内部AI评审中从未出现一次“接受”,但智能体始终未解决核心批评。

智能体还表现出糟糕的资源管理意识。两次运行结束时,API预算消耗不足一半;其中一个智能体在截止时间前七小时就宣布项目完成,而就在此前不久,其内部评审员又给出了“拒绝”。此外,智能体存在“指令漂移”现象,在长上下文中逐渐遗忘明确指令。两篇论文均超出长度限制,若提交至NeurIPS将被直接拒稿;其中一篇正文中没有任何可视化内容,而人类撰写的原稿包含15张图。Meta AI最近描述的“行为状态衰减”现象与此类似,即智能体早期识别到要求,但在修复无关错误时却违反该要求。

尽管存在这些缺陷,研究人员未发现显著的奖励黑客行为——智能体没有操纵结果或歪曲数据以追求更高分数。然而,这项研究明确表明,当前前沿模型虽能胜任研究工程流程,但在研究判断力、创造性问题解决以及放弃失败方法的能力上仍有明显不足。这与Anthropic和OpenAI近期强调其模型能加速AI研究的宣传形成鲜明对比,也为AI能力评估提供了更严格的视角。对于AI产业投资者而言,这一结果提示,在评估AI模型对科研生产力的实际影响时,需谨慎对待厂商的乐观声明。