Prime Intellect近日公佈的一項實驗顯示,在AI自主科研任務中,開源權重模型Kimi K3搭配其自研的Prime Agent Harness,以2930步的成績逼近Claude旗艦模型Opus 5的2920步,並超越了GPT-5.6 Sol的3042步。這一結果意味著,由開源模型和Agent編排框架組成的系統,在特定研究任務上已能超過部分頂級閉源模型,甚至接近第一梯隊水平。
實驗設計圍繞Karpathy著名的nanoGPT訓練任務展開。Prime Intellect將18個前沿模型——包括Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM 5.2、Muse Spark 1.1、DeepSeek V4 Pro等——投入一個目標明確、反饋快速的真實訓練場景。每個Agent需在給定baseline超引數(初始3290步)的基礎上,自主提出假設、修改最佳化器、編寫程式碼、啟動訓練、比較loss,並決定下一步實驗方向,最終目標是用盡可能少的訓練步數將1.24億引數GPT的驗證集loss降至3.28以下。整個過程在斷網sandbox中執行,防止Agent直接抄襲現成答案。
Prime Intellect共執行了153次全自主實驗,單次最長持續超過8天。結果顯示,不同模型展現出差異化的科研策略:弱模型常因單次seed失敗而放棄,強模型則更善於更換seed、重新消融,甚至在recipe變化後重測舊方案。例如,Opus 5調整β2後重新整理紀錄,Fable 5通過重新探測舊方案節省了31步。Kimi K3則展現了較強的自主性,會自行編寫實驗函式、比較loss曲線、恢復baseline,甚至搭建小型數值實驗室驗證Newton-Schulz方法後再應用於真實訓練。
從3290步baseline到2600步的人類紀錄,共有690步最佳化空間,Fable 5已消耗564步,完成約82%。實驗還發現,多個模型最終收斂到相似的最佳化思路,這暗示在特定研究任務中,idea本身可能並非稀缺資源,真正拉開差距的是試錯效率——能否快速排除錯誤、捕捉微弱訊號並迭代疊加。
這一發現直接支撐了Prime Intellect將重點轉向Multi-Agent Harness的決策。既然大量工作集中在寫程式碼、跑實驗、驗證結果等環節,就無需每一步都呼叫最貴的前沿模型。通過將監控和具體實現交給更小、更便宜的開源模型,可以顯著降低試錯成本,使AI科研能力的提升不再完全依賴下一個更強的大模型。Prime Intellect計劃將Speedrun擴充套件到訓練棧的更多環節,並繼續放大實驗規模。
OpenAI研究員翁家翌此前在Why Not TV中曾表示,真正拉開差距的是基礎設施的迭代速度——誰能更快、更穩地驗證想法、修bug、跑實驗,誰就能贏。本次實驗似乎印證了這一觀點:在Kimi K3的測試中,Prime Agent Harness提供的持久執行IPython核心,讓模型能夠圍繞研究任務自主搭建和迭代工作流。
從產業角度看,這一實驗對AI產業鏈具有多重含義。一方面,它表明模型外圍的科研基礎設施——如Agent編排框架、實驗工具鏈——可能成為新的競爭焦點,其價值不亞於模型本身的智慧水平。另一方面,開源模型與高效Harness的組合,可能降低AI研發的門檻,使更多中小型團隊有能力參與前沿研究,從而改變當前由少數閉源模型主導的競爭格局。對於算力供應商而言,這類自主科研系統對GPU等算力的需求可能進一步增長,因為實驗規模的擴大直接轉化為對計算資源的需求。
不過,也有觀點提醒,nanoGPT任務相對簡單,是否代表更復雜科研任務中的普遍規律尚需驗證。但無論如何,Prime Intellect的實驗為“AI開發AI”提供了一條可量化的路徑,其意義在於揭示了:決定AI科研速度的,可能不僅是模型本身的聰明程度,還包括支撐其不斷試錯的“機器”效率。