遞迴自我改進(Recursive Self-Improvement,RSI)正成為今年AI創業領域最密集的賽道。從3月到8月,短短半年內,多家由頂尖AI研究者創立的公司相繼浮出水面,合計融資超過10億美元,其中僅Recursive一家估值就達46.5億美元。這些公司儘管用詞各異——self-improving AI、self-accelerating AI R&D、continual learning、AI Scientist——但都指向同一個願景:讓AI參與改進AI。

RSI的嚴格定義只有一句話:AI改進“製造下一代AI”的方法,且下一代能繼承這種改進。按此標準,目前沒有一家公司真正做到。寬泛的定義則把模型自我糾錯、持續後訓練、自動跑實驗等統統歸入,但那樣幾乎所有Agent公司都算RSI。本文采用更實用的拆解:將AI改進AI的過程分為四步——提出改法、執行、驗證、保留改進。七家公司的差異,體現在三個問題的答案上:AI接管了哪幾步?驗證訊號從哪裡來、有多硬?改進能否被下一代繼承?其中,驗證訊號的硬度最為關鍵,因為能自己跑實驗的系統,最大風險是給自己打高分。

按驗證訊號從硬到軟,這七家公司可分為四個梯隊。

第一梯隊:反饋來自硬體計時——INT21

INT21由Bing Xu創立,他是GAN原始論文共同作者,其此前創辦的GPU推理公司HippoML被NVIDIA收購。INT21讓AI編寫GPU Kernel(底層程式),其產品PTX Kernel Factory通過多個Agent生成候選實現,在真實GPU上編譯、測試、測速,淘汰錯誤、保留高效方案。公司開源了四個Kernel,公佈結果顯示,Kimi Delta Attention在GH200上達到專家手寫版本的1.24至1.59倍,B200上為1.42至1.52倍;RMSNorm在GH200的11個前向測試中幾何平均快8.17%,B200的126個可比案例全部領先。INT21的優勢在於評估器——硬體計時是“不會被說服的尺子”。不過,它目前更像自動調優系統,尚未表現出能改進“如何搜尋”本身。

第二梯隊:反饋來自Benchmark——rekursiv.ai與Inherent

這一層的產品都叫AI Scientist,能像研究員一樣讀論文、提假設、跑實驗。rekursiv.ai由來自Google/DeepMind和Luma AI的Joshua V. Dillon和Dan Kondratyuk創立,入選YC S26。其系統在ARC-AGI專案上,幾天內跑了235次完整實驗,將單模型ARC-AGI-1得分從44.9%提升至71.4%,五模型整合達75.5%。但公司也公開了一次失敗:訓練出的Verifier在訓練集上大幅改善,換到評估集反而下降2個百分點。這恰恰反映了系統處理失敗的能力。不過,其能力目前被限制在ARC邊界內,過擬合風險實在。

Inherent由Tantum Collins等四人創立,總部倫敦,2026年公佈5000萬美元種子輪,Index Ventures和Radical Ventures領投。其概念是Recursive Collective Self-Improvement,改進物件是整間實驗室。其成果Faraday是一個27B引數的AI Scientist,在73%的同分布任務和60%的AI for Science留出任務上優於對照Agent,平均分比Claude Opus 4.8和GPT-5.5分別高6%和8%。Inherent用AI給AI打分、輔以人類校準,這是該層公司的典型做法,也是共同軟肋。

第三梯隊:反饋來自實驗室自身運轉——Core Automation與Mirendil

這一層公司改進的物件是實驗室本身,先用AI自動化研究,再用省下的能力發現新可自動化環節。Core Automation由Jerry Tworek(曾參與o1、o3和GPT-4)創立,目標是建高度自動化的AI Lab,目前公開內容接近路線圖。其團隊在KernelBot中遇到Reward Hacking問題,並構建了KernelGuard檢查規則。Core的優勢是研究與系統能力同隊,但也是七家中“資本先於證據”最明顯的。

Mirendil由Behnam Neyshabur等四人創立,首發團隊約20人,來自Anthropic、xAI、DeepMind和OpenAI,獲2億美元種子輪,a16z和Kleiner Perkins領投,NVIDIA參與。其路徑是先訓練一個專門擅長AI研究的前沿模型,再圍繞它重建實驗平台,並與Google Cloud簽了多年合作。Mirendil押注資料飛輪,但該飛輪目前仍在設想階段,沒有模型、演示或Benchmark。

第四梯隊:反饋來自整個發現過程——Recursive與Discovery Loop

最後兩家不僅改進模型,還要改進研究過程本身。Recursive Superintelligence由Richard Socher、田淵棟、Jeff Clune等八位創始人創立,獲6.5億美元融資,投後估值46.5億美元,GV和Greycroft領投,NVIDIA、AMD Ventures參與。其系統同時維護多條長期研究分支,並在接受結果前檢查是否為Reward Hack。6月公佈的三項結果中,NanoChat的Validation BPB從0.9372降至0.9109,NanoGPT達到指定Loss的時間從79.7秒降至77.5秒,SOL-ExecBench的235個Kernel平均分從0.699升至0.754。儘管數字本身不大,但跑通了完整閉環,且公開了方法與不確定性。Jeff Clune和Tim Rocktäschel在開放式演算法上的積累,是其有機會推進到“改進研究方法”的原因。

Discovery Loop由Jeff Dean、Sanjay Ghemawat、Oriol Vinyals和Quoc Le於8月成立,目前公開資訊有限。

總體來看,RSI賽道雖熱,但多數公司仍處於早期,驗證訊號的硬度與改進的傳承性是決定其能否兌現願景的關鍵。對投資者而言,這既是一個充滿想象力的方向,也需警惕“自我打分”帶來的泡沫風險。