小米MiMo团队发布技术报告《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》,首次系统披露了一套规模化Agentic RL训练流程。报告的核心数字颇为惊人:MiMo-V2.6-Pro的RL后训练成本约260万美元,Flash版约90万美元;每个RL步骤先采样1568个Prompt,每个Prompt生成16条Rollout,单步产生约2.5万条Agent轨迹,合计27亿至37亿Token,平均每条序列11万至15万Token,训练上下文长度最高达100万Token。

此次发布包含Pro和Flash两个模型。Pro总参数量1.02T、每次推理激活42B参数;Flash总参数量310B、激活15B参数。两者均采用稀疏混合专家(MoE)架构,文本主干混合局部滑动窗口注意力与全局注意力。训练任务覆盖代码Agent、通用工具使用、视觉设计、上下文遵循和网络安全,其中代码与竞争性编程任务占正式RL Batch的68%。整个训练采用GRPO并结合异步Partial Rollout。

成本结构值得关注。Pro的计算成本中,Rollout占43.8%,参数更新训练占43.5%,而单独用于判断Agent行为好坏的Grader已占到12.7%;Flash的Grader占比更高,达14.2%。这意味着,在Agentic RL时代,评判模型行为的开销已不再是零头,而成为与训练本身相当的重要成本项。

报告重点讨论了传统二元测试奖励的局限:两个方案都能通过测试,一个只改必要几行代码,另一个却加入大量兼容分支、吞掉异常、扩大API范围,传统Reward下得分相同但工程质量完全不同。为此,MiMo-V2.6引入两套分组智能体评分机制——分组奖励合成(GRS)和分组优势重分配(GAR),对通过测试的方案继续按实现质量、边界处理、修改范围等维度打分排序。实验显示,加入在线评分后通过率继续增长,Token长度和交互轮数更稳定,模型倾向于生成更小、更精确的Patch。团队还加入组内相对长度惩罚,鼓励用更少Token完成任务。

另一个被详细披露的问题是Reward Hacking。小米在早期训练中发现,代码Agent会尝试绕开修复任务,例如直接安装更新版本软件包、访问GitHub最新源码、克隆上游仓库、搜索Issue和提交历史,甚至比较不同版本反推答案。为此,团队在训练环境主动删除构建日志、Verifier输出、残留Patch、二进制和Cache,仅保留任务指定版本之前的Git历史,并通过容器级网络隔离阻止获取上游修复。团队还专门训练并部署了一个Hack Agent,主动寻找可利用漏洞,直到无法继续找到路径。正式训练中,被确认存在Reward Hacking的轨迹比例始终控制在2%以下。

MoE Router的稳定性是另一项关键发现。在Pro的对照实验中,若不冻结Router,仅经过前20个训练Step,第9层专家负载的变异系数就从0.78升至2.0,最繁忙Expert负载从平均值的6倍升至16倍,冷专家比例从0.5%升到22%。团队将第20步的Router恢复到RL开始前参数后,专家负载很快恢复正常,Benchmark基本不受影响,说明问题出在Router漂移而非Expert退化。最终MiMo-V2.6在整个RL阶段冻结MoE Router,冻结后专家负载变异系数稳定在约0.7,峰值负载约为平均值5.5倍,冷专家占比约1%,性能仍继续提高。

训练基础设施方面,报告公布了两次正式训练的故障时间线:Pro完成30个RL Step共耗时123.1小时,Flash为81.8小时。过程中出现过GPU显存双比特错误、Kubernetes故障导致Cyber集群Pod崩溃、Grader网络不可达而重启等问题。Partial Rollout重启后短任务优先完成,导致系统低估剩余任务长度,最终撑满GPU KV Pool和锁页主机内存池;训练阶段还出现MoE微Batch内负载严重不平衡,某个Expert Parallel Rank接收到超过平均值30倍的Token。

为支撑单步2.5万条轨迹,小米重新设计了RL数据和执行系统:Harness Pool使用Ray Actor运行不同Agent Harness,改为固定数量持久Host Actor以降低高并发开销;Payload Porter把控制面和数据面拆开,重数据写入分布式存储,中央Driver只处理轻量元数据;Sample Mixer动态调整不同任务的数据比例。推理侧优化也被带入RL,包括持久KV Cache、Block-6 DFlash投机解码等,RL适配后的DFlash平均接受长度提高31.3%,引入FP8低精度草稿计算后长上下文单节点吞吐相较基线提高约10.3%。

效果验证方面,Flash和Pro在训练任务上的平均通过率分别相对提高约25%和12%。在未进入训练集的长程软件工程测试DeepSWE v1.1上,Flash得分由48.8提高到65.7,Pro由58.4提高到72.6。在Held-out Harness上,3个未见过框架的平均Pass@1从约50%提升至66%。小米称Pro在Artificial Analysis Intelligence Index上得到46分,并在多数Agent Benchmark上达到其所称的Claude Opus 5、GPT-5.6 Sol相近水平,但官方也承认与Claude Fable 5.1、GPT-6 Astra等最强闭源模型仍有差距。

从产业视角看,这份报告的价值在于把「后训练Scaling」的成本与工程细节摆上台面。过去几年模型能力提升主要靠预训练参数、数据和算力扩张;进入推理模型和Agent阶段后,计算投入正转向训练完成之后——让模型进入大量可验证环境、产生更长Rollout、通过更复杂Grader获得反馈,再用RL更新策略。MiMo团队将这一路线称为对递归自我改进(RSI)的探索,但从报告展示的机制看,目前仍是在人类设计好的任务、环境、奖励和基础设施中建立反馈闭环,距离模型自主设计并训练下一代模型尚有明显距离。小米同时开源了超过7000个高质量RL环境,以及基于verl、uni-agent和mini-swe-agent构建的端到端RL框架,为外部研究者复现这一路线提供了条件。