Prime Intellect近日公布的一项实验显示,在AI自主科研任务中,开源权重模型Kimi K3搭配其自研的Prime Agent Harness,以2930步的成绩逼近Claude旗舰模型Opus 5的2920步,并超越了GPT-5.6 Sol的3042步。这一结果意味着,由开源模型和Agent编排框架组成的系统,在特定研究任务上已能超过部分顶级闭源模型,甚至接近第一梯队水平。

实验设计围绕Karpathy著名的nanoGPT训练任务展开。Prime Intellect将18个前沿模型——包括Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM 5.2、Muse Spark 1.1、DeepSeek V4 Pro等——投入一个目标明确、反馈快速的真实训练场景。每个Agent需在给定baseline超参数(初始3290步)的基础上,自主提出假设、修改优化器、编写代码、启动训练、比较loss,并决定下一步实验方向,最终目标是用尽可能少的训练步数将1.24亿参数GPT的验证集loss降至3.28以下。整个过程在断网sandbox中运行,防止Agent直接抄袭现成答案。

Prime Intellect共执行了153次全自主实验,单次最长持续超过8天。结果显示,不同模型展现出差异化的科研策略:弱模型常因单次seed失败而放弃,强模型则更善于更换seed、重新消融,甚至在recipe变化后重测旧方案。例如,Opus 5调整β2后刷新纪录,Fable 5通过重新探测旧方案节省了31步。Kimi K3则展现了较强的自主性,会自行编写实验函数、比较loss曲线、恢复baseline,甚至搭建小型数值实验室验证Newton-Schulz方法后再应用于真实训练。

从3290步baseline到2600步的人类纪录,共有690步优化空间,Fable 5已消耗564步,完成约82%。实验还发现,多个模型最终收敛到相似的优化思路,这暗示在特定研究任务中,idea本身可能并非稀缺资源,真正拉开差距的是试错效率——能否快速排除错误、捕捉微弱信号并迭代叠加。

这一发现直接支撑了Prime Intellect将重点转向Multi-Agent Harness的决策。既然大量工作集中在写代码、跑实验、验证结果等环节,就无需每一步都调用最贵的前沿模型。通过将监控和具体实现交给更小、更便宜的开源模型,可以显著降低试错成本,使AI科研能力的提升不再完全依赖下一个更强的大模型。Prime Intellect计划将Speedrun扩展到训练栈的更多环节,并继续放大实验规模。

OpenAI研究员翁家翌此前在Why Not TV中曾表示,真正拉开差距的是基础设施的迭代速度——谁能更快、更稳地验证想法、修bug、跑实验,谁就能赢。本次实验似乎印证了这一观点:在Kimi K3的测试中,Prime Agent Harness提供的持久运行IPython内核,让模型能够围绕研究任务自主搭建和迭代工作流。

从产业角度看,这一实验对AI产业链具有多重含义。一方面,它表明模型外围的科研基础设施——如Agent编排框架、实验工具链——可能成为新的竞争焦点,其价值不亚于模型本身的智能水平。另一方面,开源模型与高效Harness的组合,可能降低AI研发的门槛,使更多中小型团队有能力参与前沿研究,从而改变当前由少数闭源模型主导的竞争格局。对于算力供应商而言,这类自主科研系统对GPU等算力的需求可能进一步增长,因为实验规模的扩大直接转化为对计算资源的需求。

不过,也有观点提醒,nanoGPT任务相对简单,是否代表更复杂科研任务中的普遍规律尚需验证。但无论如何,Prime Intellect的实验为“AI开发AI”提供了一条可量化的路径,其意义在于揭示了:决定AI科研速度的,可能不仅是模型本身的聪明程度,还包括支撑其不断试错的“机器”效率。