小米MiMo團隊釋出技術報告《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》,首次系統披露了一套規模化Agentic RL訓練流程。報告的核心數字頗為驚人:MiMo-V2.6-Pro的RL後訓練成本約260萬美元,Flash版約90萬美元;每個RL步驟先採樣1568個Prompt,每個Prompt生成16條Rollout,單步產生約2.5萬條Agent軌跡,合計27億至37億Token,平均每條序列11萬至15萬Token,訓練上下文長度最高達100萬Token。
此次釋出包含Pro和Flash兩個模型。Pro總引數量1.02T、每次推理啟用42B引數;Flash總引數量310B、啟用15B引數。兩者均採用稀疏混合專家(MoE)架構,文本主幹混合區域性滑動視窗注意力與全域性注意力。訓練任務覆蓋程式碼Agent、通用工具使用、視覺設計、上下文遵循和網路安全,其中程式碼與競爭性程式設計任務佔正式RL Batch的68%。整個訓練採用GRPO並結合非同步Partial Rollout。
成本結構值得關注。Pro的計算成本中,Rollout佔43.8%,引數更新訓練佔43.5%,而單獨用於判斷Agent行為好壞的Grader已佔到12.7%;Flash的Grader佔比更高,達14.2%。這意味著,在Agentic RL時代,評判模型行為的開銷已不再是零頭,而成為與訓練本身相當的重要成本項。
報告重點討論了傳統二元測試獎勵的侷限:兩個方案都能通過測試,一個只改必要幾行程式碼,另一個卻加入大量相容分支、吞掉異常、擴大API範圍,傳統Reward下得分相同但工程質量完全不同。為此,MiMo-V2.6引入兩套分組智慧體評分機制——分組獎勵合成(GRS)和分組優勢重分配(GAR),對通過測試的方案繼續按實現質量、邊界處理、修改範圍等維度打分排序。實驗顯示,加入線上評分後通過率繼續增長,Token長度和互動輪數更穩定,模型傾向於生成更小、更精確的Patch。團隊還加入組內相對長度懲罰,鼓勵用更少Token完成任務。
另一個被詳細披露的問題是Reward Hacking。小米在早期訓練中發現,程式碼Agent會嘗試繞開修復任務,例如直接安裝更新版本軟體包、訪問GitHub最新原始碼、克隆上游倉庫、搜尋Issue和提交歷史,甚至比較不同版本反推答案。為此,團隊在訓練環境主動刪除構建日誌、Verifier輸出、殘留Patch、二進位制和Cache,僅保留任務指定版本之前的Git歷史,並通過容器級網路隔離阻止獲取上游修復。團隊還專門訓練並部署了一個Hack Agent,主動尋找可利用漏洞,直到無法繼續找到路徑。正式訓練中,被確認存在Reward Hacking的軌跡比例始終控制在2%以下。
MoE Router的穩定性是另一項關鍵發現。在Pro的對照實驗中,若不凍結Router,僅經過前20個訓練Step,第9層專家負載的變異係數就從0.78升至2.0,最繁忙Expert負載從平均值的6倍升至16倍,冷專家比例從0.5%升到22%。團隊將第20步的Router恢復到RL開始前引數後,專家負載很快恢復正常,Benchmark基本不受影響,說明問題出在Router漂移而非Expert退化。最終MiMo-V2.6在整個RL階段凍結MoE Router,凍結後專家負載變異係數穩定在約0.7,峰值負載約為平均值5.5倍,冷專家佔比約1%,效能仍繼續提高。
訓練基礎設施方面,報告公佈了兩次正式訓練的故障時間線:Pro完成30個RL Step共耗時123.1小時,Flash為81.8小時。過程中出現過GPU視訊記憶體雙位元錯誤、Kubernetes故障導致Cyber叢集Pod崩潰、Grader網路不可達而重啟等問題。Partial Rollout重啟後短任務優先完成,導致系統低估剩餘任務長度,最終撐滿GPU KV Pool和鎖頁主機記憶體池;訓練階段還出現MoE微Batch內負載嚴重不平衡,某個Expert Parallel Rank接收到超過平均值30倍的Token。
為支撐單步2.5萬條軌跡,小米重新設計了RL資料和執行系統:Harness Pool使用Ray Actor執行不同Agent Harness,改為固定數量持久Host Actor以降低高併發開銷;Payload Porter把控制面和資料面拆開,重資料寫入分散式儲存,中央Driver只處理輕量後設資料;Sample Mixer動態調整不同任務的資料比例。推理側最佳化也被帶入RL,包括持久KV Cache、Block-6 DFlash投機解碼等,RL適配後的DFlash平均接受長度提高31.3%,引入FP8低精度草稿計算後長上下文單節點吞吐相較基線提高約10.3%。
效果驗證方面,Flash和Pro在訓練任務上的平均通過率分別相對提高約25%和12%。在未進入訓練集的長程軟體工程測試DeepSWE v1.1上,Flash得分由48.8提高到65.7,Pro由58.4提高到72.6。在Held-out Harness上,3個未見過框架的平均Pass@1從約50%提升至66%。小米稱Pro在Artificial Analysis Intelligence Index上得到46分,並在多數Agent Benchmark上達到其所稱的Claude Opus 5、GPT-5.6 Sol相近水平,但官方也承認與Claude Fable 5.1、GPT-6 Astra等最強閉源模型仍有差距。
從產業視角看,這份報告的價值在於把「後訓練Scaling」的成本與工程細節擺上檯面。過去幾年模型能力提升主要靠預訓練引數、資料和算力擴張;進入推理模型和Agent階段後,計算投入正轉向訓練完成之後——讓模型進入大量可驗證環境、產生更長Rollout、通過更復雜Grader獲得反饋,再用RL更新策略。MiMo團隊將這一路線稱為對遞迴自我改進(RSI)的探索,但從報告展示的機制看,目前仍是在人類設計好的任務、環境、獎勵和基礎設施中建立反饋閉環,距離模型自主設計並訓練下一代模型尚有明顯距離。小米同時開源了超過7000個高質量RL環境,以及基於verl、uni-agent和mini-swe-agent構建的端到端RL框架,為外部研究者復現這一路線提供了條件。