小米大模型團隊首次把強化學習階段的訓練賬本攤開給外界看。9月17日凌晨,小米MiMo大模型團隊負責人羅福莉在社交平台發文,稱團隊沉默近半年一直在研究強化學習(RL)究竟能走多遠,並透露MiMo-V2.6目前處於強化學習中間階段。
她同時曬出了該模型的即時訓練頁面,讓外界第一次看到這一代模型在RL階段的部分訓練狀態。頁面覆蓋MiMo-V2.6-Pro與MiMo-V2.6-Flash兩個版本,展示內容包括訓練進度、Token消耗、訓練成本、樣本數量以及多項內部指標變化。
據介面新聞,截至17日下午,兩個版本累計訓練成本已超過135萬美元。其中MiMo-V2.6-Pro訓練時長1天21個小時,耗費超93萬美元,平均每小時超2萬美元;MiMo-V2.6-Flash訓練時長1天16小時,耗費超42萬美元,平均每小時超1萬美元。兩者合計,每小時花費約3.1萬美元,摺合人民幣超20萬元。
羅福莉還介紹了團隊正在推進的三方面擴充套件:一是計算資源,每步約20億個Token,採用1568個Prompt乘以16次Rollout、完全非同步的方式;二是環境和測試框架,做多工智慧體強化學習,在一次執行中混合多個框架;三是評估計算,採用代理式組內信用分配,帶有測試用例和基於量規的獎勵。她表示,MiMo團隊將在接下來幾周內逐步開源相關細節。
公開資料顯示,羅福莉1995年出生於四川宜賓,本科就讀於北京師範大學計算機專業,碩士畢業於北京大學計算語言學研究所。2019年她在人工智慧頂級會議ACL上發表8篇論文,其中2篇為第一作者。她的職業生涯起步於阿里巴巴達摩院,主導開發多語言預訓練模型VECO並推動AliceMind開源;2022年加入DeepSeek母公司幻方量化從事深度學習工作,後擔任DeepSeek深度學習研究員,參與研發DeepSeek-V2等模型,因此被外界稱為“AI才女”。
2025年初,據證券時報報道,小米創始人雷軍曾希望以千萬元年薪邀請她加入小米、帶領團隊從事AI大模型研究,該訊息一度登上微博熱搜。去年11月,羅福莉官宣加入小米,在朋友圈表示智慧將從語言邁向物理世界,她正在Xiaomi MiMo與研究員們一起構建這樣的未來。Xiaomi MiMo是小米首個推理大模型。一個月後,她以MiMo大模型負責人身份在小米“人車家全生態”合作伙伴大會上完成加入後的首秀,提出下一代智慧體系統應圍繞Agent執行與Omni感知,從回答問題走向完成任務。
今年3月,小米推出MiMo-V2-Pro、MiMo-V2-Omni與MiMo-V2-TTS三款自研大模型。其中MiMo-V2-Pro是旗艦文本基座,面向高強度Agent場景,主打推理、規劃與工具呼叫,總引數規模突破1萬億(1T),啟用引數42B,採用改進後的混合注意力機制,上下文視窗擴充套件至100萬Token;MiMo-V2-Omni為全模態Agent基座,原生融合文本、視覺與音訊;MiMo-V2-TTS則負責語音合成與情感表達。雷軍當時在社交平台表示,小米今年在AI領域的研發和資本投入將超過160億元,並稱MiMo-V2-Pro在全球大模型綜合智慧排行榜Artificial Analysis上位列全球第八,按品牌排名全球第五。
從這次披露看,強化學習階段的算力開銷正成為大模型競賽中最“燒錢”的環節之一。按公開資料,MiMo-V2.6兩個版本合計每小時超20萬元人民幣的訓練成本,直觀呈現了頭部模型在RL擴充套件上的投入量級。對關注AI產業的投資者而言,這既反映小米在模型層的資本開支強度,也提示強化學習路線的工程複雜度與成本門檻;而團隊承諾的逐步開源,則可能為國產大模型的訓練方法論提供更多可參照的細節。