递归自我改进(Recursive Self-Improvement,RSI)正成为今年AI创业领域最密集的赛道。从3月到8月,短短半年内,多家由顶尖AI研究者创立的公司相继浮出水面,合计融资超过10亿美元,其中仅Recursive一家估值就达46.5亿美元。这些公司尽管用词各异——self-improving AI、self-accelerating AI R&D、continual learning、AI Scientist——但都指向同一个愿景:让AI参与改进AI。
RSI的严格定义只有一句话:AI改进“制造下一代AI”的方法,且下一代能继承这种改进。按此标准,目前没有一家公司真正做到。宽泛的定义则把模型自我纠错、持续后训练、自动跑实验等统统归入,但那样几乎所有Agent公司都算RSI。本文采用更实用的拆解:将AI改进AI的过程分为四步——提出改法、执行、验证、保留改进。七家公司的差异,体现在三个问题的答案上:AI接管了哪几步?验证信号从哪里来、有多硬?改进能否被下一代继承?其中,验证信号的硬度最为关键,因为能自己跑实验的系统,最大风险是给自己打高分。
按验证信号从硬到软,这七家公司可分为四个梯队。
第一梯队:反馈来自硬件计时——INT21
INT21由Bing Xu创立,他是GAN原始论文共同作者,其此前创办的GPU推理公司HippoML被NVIDIA收购。INT21让AI编写GPU Kernel(底层程序),其产品PTX Kernel Factory通过多个Agent生成候选实现,在真实GPU上编译、测试、测速,淘汰错误、保留高效方案。公司开源了四个Kernel,公布结果显示,Kimi Delta Attention在GH200上达到专家手写版本的1.24至1.59倍,B200上为1.42至1.52倍;RMSNorm在GH200的11个前向测试中几何平均快8.17%,B200的126个可比案例全部领先。INT21的优势在于评估器——硬件计时是“不会被说服的尺子”。不过,它目前更像自动调优系统,尚未表现出能改进“如何搜索”本身。
第二梯队:反馈来自Benchmark——rekursiv.ai与Inherent
这一层的产品都叫AI Scientist,能像研究员一样读论文、提假设、跑实验。rekursiv.ai由来自Google/DeepMind和Luma AI的Joshua V. Dillon和Dan Kondratyuk创立,入选YC S26。其系统在ARC-AGI项目上,几天内跑了235次完整实验,将单模型ARC-AGI-1得分从44.9%提升至71.4%,五模型集成达75.5%。但公司也公开了一次失败:训练出的Verifier在训练集上大幅改善,换到评估集反而下降2个百分点。这恰恰反映了系统处理失败的能力。不过,其能力目前被限制在ARC边界内,过拟合风险实在。
Inherent由Tantum Collins等四人创立,总部伦敦,2026年公布5000万美元种子轮,Index Ventures和Radical Ventures领投。其概念是Recursive Collective Self-Improvement,改进对象是整间实验室。其成果Faraday是一个27B参数的AI Scientist,在73%的同分布任务和60%的AI for Science留出任务上优于对照Agent,平均分比Claude Opus 4.8和GPT-5.5分别高6%和8%。Inherent用AI给AI打分、辅以人类校准,这是该层公司的典型做法,也是共同软肋。
第三梯队:反馈来自实验室自身运转——Core Automation与Mirendil
这一层公司改进的对象是实验室本身,先用AI自动化研究,再用省下的能力发现新可自动化环节。Core Automation由Jerry Tworek(曾参与o1、o3和GPT-4)创立,目标是建高度自动化的AI Lab,目前公开内容接近路线图。其团队在KernelBot中遇到Reward Hacking问题,并构建了KernelGuard检查规则。Core的优势是研究与系统能力同队,但也是七家中“资本先于证据”最明显的。
Mirendil由Behnam Neyshabur等四人创立,首发团队约20人,来自Anthropic、xAI、DeepMind和OpenAI,获2亿美元种子轮,a16z和Kleiner Perkins领投,NVIDIA参与。其路径是先训练一个专门擅长AI研究的前沿模型,再围绕它重建实验平台,并与Google Cloud签了多年合作。Mirendil押注数据飞轮,但该飞轮目前仍在设想阶段,没有模型、演示或Benchmark。
第四梯队:反馈来自整个发现过程——Recursive与Discovery Loop
最后两家不仅改进模型,还要改进研究过程本身。Recursive Superintelligence由Richard Socher、田渊栋、Jeff Clune等八位创始人创立,获6.5亿美元融资,投后估值46.5亿美元,GV和Greycroft领投,NVIDIA、AMD Ventures参与。其系统同时维护多条长期研究分支,并在接受结果前检查是否为Reward Hack。6月公布的三项结果中,NanoChat的Validation BPB从0.9372降至0.9109,NanoGPT达到指定Loss的时间从79.7秒降至77.5秒,SOL-ExecBench的235个Kernel平均分从0.699升至0.754。尽管数字本身不大,但跑通了完整闭环,且公开了方法与不确定性。Jeff Clune和Tim Rocktäschel在开放式算法上的积累,是其有机会推进到“改进研究方法”的原因。
Discovery Loop由Jeff Dean、Sanjay Ghemawat、Oriol Vinyals和Quoc Le于8月成立,目前公开信息有限。
总体来看,RSI赛道虽热,但多数公司仍处于早期,验证信号的硬度与改进的传承性是决定其能否兑现愿景的关键。对投资者而言,这既是一个充满想象力的方向,也需警惕“自我打分”带来的泡沫风险。