小米正式釋出並開源 MiMo-V2.6。Pro 版本擁有 1.02T 總引數42B 啟用引數,Flash 版本為 309B 總引數15B 啟用引數,兩款模型均支援 1M token 上下文,並覆蓋文本、影像、影片和音訊輸入。與單純強調規模不同,小米此次把更多篇幅放在預訓練之後的能力提升路徑上,後訓練成為 MiMo-V2.6 的核心環節。

小米將程式碼、通用 Agent、視覺和網路安全任務放進同一套強化學習系統,單次 RL 更新使用 1568 個 prompt,每個 prompt 生成 16 條 rollout,一次更新對應約 25088 條軌跡。這些任務中的 Agent 並非生成一段文本就結束,而是需要持續讀取環境、搜尋資訊、呼叫工具、執行操作,再根據返回結果調整下一步行動。訓練物件因此從最終答案擴充套件為包含狀態、決策和反饋的整條行為軌跡。

在架構層面,MiMo-V2.6-Pro 的 70 層 Transformer 中有 60 層採用 Sliding Window Attention,視窗僅 128 token,另外 10 層使用 Global Attention。這種設計讓絕大多數層只處理附近資訊,長距離通訊由少量全域性層承擔,使 1M 上下文不必讓每一層、每個 token 都與完整上下文互動。引數側採用稀疏 MoE,每個 MoE 層有 384 個 routed expert,每個 token 只調用其中 8 個,從而在維持專家容量的同時控制單 token 計算量。模型還加入 5 層 MTP speculative decoder,官方模型卡給出的設計是一次前向預測後續 7 個 token

這些取捨在 RL 階段意義更明顯。一次訓練同時生成數萬條 rollout、每條軌跡持續幾十輪,任何單 token 計算量的增加都會被迅速放大。當單條軌跡能以更低成本持續生成,RL 才有空間把 rollout 數量推上去,而計算壓力也隨之從模型內部蔓延到整個訓練系統。

25088 條軌跡不會按統一節奏結束:有的程式碼任務幾輪操作就找到問題,有的會反覆執行測試、讀取報錯再修改;網路安全任務可能經歷多次環境驗證,視覺 Agent 又有不同執行鏈路。若採用嚴格同步方式,已完成任務的計算資源需要等待少數仍在執行的軌跡。MiMo-V2.6 使用 fully asynchronous GRPO,把 rollout、環境執行、grader 和模型更新拆開執行,生成側完成一條軌跡後可繼續領取任務,訓練側消費已準備好的資料。

在資料組織上,小米沒有為程式碼、通用 Agent、視覺和網路安全分別訓練獨立策略,而是把多領域任務以及不同 Agent harness 混入同一次 RL,稱為 You Only RL Once。這些任務環境不同,但共享大量決策結構,例如判斷當前狀態缺什麼資訊、該呼叫哪個工具、執行結果是否符合預期、失敗後應繼續搜尋還是修改方案。多個 harness 則改變 system prompt、工具定義和上下文組織方式,使模型更難把某一種固定介面當成解題捷徑。

反饋層面,傳統可驗證 RL 依賴 binary reward,但放進幾十步甚至更長的 Agent 軌跡後,大量過程差異會被壓成同一個數字。MiMo-V2.6 因此把 grader 從結果檢查器進一步變成組內比較器。GRS(Groupwise Reward Synthesis) 會同時觀察同一道任務產生的多條 rollout,從差異中構造 task-specific rubric,把過程質量與測試結果結合;GAR(Groupwise Advantage Redistribution) 則在多條軌跡都完成任務時繼續比較,把更多 advantage 分配給質量較高的方案。官方提到,該過程結合環境加固、異常篩查和 verifier cross-check 來處理 reward hacking。

針對缺少穩定自動 verifier 的開放式 Agent 任務,MiMo-V2.6 在混合 RL 之後加入 MOPD2(Multi-Prefix Multi-Teacher On-Policy Distillation),複用 Teacher trajectory 和 SFT demonstration 中已有的歷史,把軌跡擷取到某個中間狀態,再讓學生從這裡繼續 rollout。例如一條任務需要 40 步到達關鍵決策位置,訓練該位置時不必反覆生成前面 39 步,歷史狀態可直接作為 prefix,訓練資源集中到後續決策。

整體來看,MiMo-V2.6 展示的方向是:Agent 能力提升越來越依賴整個訓練閉環的吞吐和反饋質量。引數繼續擴大仍有價值,但到了 Agent 階段,訓練系統能生產多少有價值的行為軌跡、又能從這些軌跡中轉化出多少有效學習訊號,已成為難以忽略的變數。