小米大模型团队首次把强化学习阶段的训练账本摊开给外界看。9月17日凌晨,小米MiMo大模型团队负责人罗福莉在社交平台发文,称团队沉默近半年一直在研究强化学习(RL)究竟能走多远,并透露MiMo-V2.6目前处于强化学习中间阶段。
她同时晒出了该模型的实时训练页面,让外界第一次看到这一代模型在RL阶段的部分训练状态。页面覆盖MiMo-V2.6-Pro与MiMo-V2.6-Flash两个版本,展示内容包括训练进度、Token消耗、训练成本、样本数量以及多项内部指标变化。
据界面新闻,截至17日下午,两个版本累计训练成本已超过135万美元。其中MiMo-V2.6-Pro训练时长1天21个小时,耗费超93万美元,平均每小时超2万美元;MiMo-V2.6-Flash训练时长1天16小时,耗费超42万美元,平均每小时超1万美元。两者合计,每小时花费约3.1万美元,折合人民币超20万元。
罗福莉还介绍了团队正在推进的三方面扩展:一是计算资源,每步约20亿个Token,采用1568个Prompt乘以16次Rollout、完全异步的方式;二是环境和测试框架,做多任务智能体强化学习,在一次运行中混合多个框架;三是评估计算,采用代理式组内信用分配,带有测试用例和基于量规的奖励。她表示,MiMo团队将在接下来几周内逐步开源相关细节。
公开资料显示,罗福莉1995年出生于四川宜宾,本科就读于北京师范大学计算机专业,硕士毕业于北京大学计算语言学研究所。2019年她在人工智能顶级会议ACL上发表8篇论文,其中2篇为第一作者。她的职业生涯起步于阿里巴巴达摩院,主导开发多语言预训练模型VECO并推动AliceMind开源;2022年加入DeepSeek母公司幻方量化从事深度学习工作,后担任DeepSeek深度学习研究员,参与研发DeepSeek-V2等模型,因此被外界称为“AI才女”。
2025年初,据证券时报报道,小米创始人雷军曾希望以千万元年薪邀请她加入小米、带领团队从事AI大模型研究,该消息一度登上微博热搜。去年11月,罗福莉官宣加入小米,在朋友圈表示智能将从语言迈向物理世界,她正在Xiaomi MiMo与研究员们一起构建这样的未来。Xiaomi MiMo是小米首个推理大模型。一个月后,她以MiMo大模型负责人身份在小米“人车家全生态”合作伙伴大会上完成加入后的首秀,提出下一代智能体系统应围绕Agent执行与Omni感知,从回答问题走向完成任务。
今年3月,小米推出MiMo-V2-Pro、MiMo-V2-Omni与MiMo-V2-TTS三款自研大模型。其中MiMo-V2-Pro是旗舰文本基座,面向高强度Agent场景,主打推理、规划与工具调用,总参数规模突破1万亿(1T),激活参数42B,采用改进后的混合注意力机制,上下文窗口扩展至100万Token;MiMo-V2-Omni为全模态Agent基座,原生融合文本、视觉与音频;MiMo-V2-TTS则负责语音合成与情感表达。雷军当时在社交平台表示,小米今年在AI领域的研发和资本投入将超过160亿元,并称MiMo-V2-Pro在全球大模型综合智能排行榜Artificial Analysis上位列全球第八,按品牌排名全球第五。
从这次披露看,强化学习阶段的算力开销正成为大模型竞赛中最“烧钱”的环节之一。按公开数据,MiMo-V2.6两个版本合计每小时超20万元人民币的训练成本,直观呈现了头部模型在RL扩展上的投入量级。对关注AI产业的投资者而言,这既反映小米在模型层的资本开支强度,也提示强化学习路线的工程复杂度与成本门槛;而团队承诺的逐步开源,则可能为国产大模型的训练方法论提供更多可参照的细节。