小米正式发布并开源 MiMo-V2.6。Pro 版本拥有 1.02T 总参数42B 激活参数,Flash 版本为 309B 总参数15B 激活参数,两款模型均支持 1M token 上下文,并覆盖文本、图像、视频和音频输入。与单纯强调规模不同,小米此次把更多篇幅放在预训练之后的能力提升路径上,后训练成为 MiMo-V2.6 的核心环节。

小米将代码、通用 Agent、视觉和网络安全任务放进同一套强化学习系统,单次 RL 更新使用 1568 个 prompt,每个 prompt 生成 16 条 rollout,一次更新对应约 25088 条轨迹。这些任务中的 Agent 并非生成一段文本就结束,而是需要持续读取环境、搜索信息、调用工具、执行操作,再根据返回结果调整下一步行动。训练对象因此从最终答案扩展为包含状态、决策和反馈的整条行为轨迹。

在架构层面,MiMo-V2.6-Pro 的 70 层 Transformer 中有 60 层采用 Sliding Window Attention,窗口仅 128 token,另外 10 层使用 Global Attention。这种设计让绝大多数层只处理附近信息,长距离通信由少量全局层承担,使 1M 上下文不必让每一层、每个 token 都与完整上下文交互。参数侧采用稀疏 MoE,每个 MoE 层有 384 个 routed expert,每个 token 只调用其中 8 个,从而在维持专家容量的同时控制单 token 计算量。模型还加入 5 层 MTP speculative decoder,官方模型卡给出的设计是一次前向预测后续 7 个 token

这些取舍在 RL 阶段意义更明显。一次训练同时生成数万条 rollout、每条轨迹持续几十轮,任何单 token 计算量的增加都会被迅速放大。当单条轨迹能以更低成本持续生成,RL 才有空间把 rollout 数量推上去,而计算压力也随之从模型内部蔓延到整个训练系统。

25088 条轨迹不会按统一节奏结束:有的代码任务几轮操作就找到问题,有的会反复运行测试、读取报错再修改;网络安全任务可能经历多次环境验证,视觉 Agent 又有不同执行链路。若采用严格同步方式,已完成任务的计算资源需要等待少数仍在运行的轨迹。MiMo-V2.6 使用 fully asynchronous GRPO,把 rollout、环境执行、grader 和模型更新拆开运行,生成侧完成一条轨迹后可继续领取任务,训练侧消费已准备好的数据。

在数据组织上,小米没有为代码、通用 Agent、视觉和网络安全分别训练独立策略,而是把多领域任务以及不同 Agent harness 混入同一次 RL,称为 You Only RL Once。这些任务环境不同,但共享大量决策结构,例如判断当前状态缺什么信息、该调用哪个工具、执行结果是否符合预期、失败后应继续搜索还是修改方案。多个 harness 则改变 system prompt、工具定义和上下文组织方式,使模型更难把某一种固定接口当成解题捷径。

反馈层面,传统可验证 RL 依赖 binary reward,但放进几十步甚至更长的 Agent 轨迹后,大量过程差异会被压成同一个数字。MiMo-V2.6 因此把 grader 从结果检查器进一步变成组内比较器。GRS(Groupwise Reward Synthesis) 会同时观察同一道任务产生的多条 rollout,从差异中构造 task-specific rubric,把过程质量与测试结果结合;GAR(Groupwise Advantage Redistribution) 则在多条轨迹都完成任务时继续比较,把更多 advantage 分配给质量较高的方案。官方提到,该过程结合环境加固、异常筛查和 verifier cross-check 来处理 reward hacking。

针对缺少稳定自动 verifier 的开放式 Agent 任务,MiMo-V2.6 在混合 RL 之后加入 MOPD2(Multi-Prefix Multi-Teacher On-Policy Distillation),复用 Teacher trajectory 和 SFT demonstration 中已有的历史,把轨迹截取到某个中间状态,再让学生从这里继续 rollout。例如一条任务需要 40 步到达关键决策位置,训练该位置时不必反复生成前面 39 步,历史状态可直接作为 prefix,训练资源集中到后续决策。

整体来看,MiMo-V2.6 展示的方向是:Agent 能力提升越来越依赖整个训练闭环的吞吐和反馈质量。参数继续扩大仍有价值,但到了 Agent 阶段,训练系统能生产多少有价值的行为轨迹、又能从这些轨迹中转化出多少有效学习信号,已成为难以忽略的变量。