小米MiMo大模型負責人羅福莉在9月23日晚發文,提前披露了下一代模型MiMo-V3的新架構,率先登場的是核心元件HySparse2,相關技術論文同步公佈。這是距離小米上一輪模型更新僅兩天後的又一次技術動作——9月22日,小米大模型團隊剛釋出並開源Xiaomi MiMo-V2.6系列,並預告後續將逐步開放MiMo-V2.6-Pro-UltraSpeed。
HySparse2要解決的問題與Agent的工作模式直接相關。在Agent多輪任務中,模型生成的動作往往很短,但工具返回的內容可能很長:一句搜尋指令之後,搜尋引擎可能返回一篇長文件;一次程式碼呼叫之後,程式碼工具可能返回大量執行日誌。模型在下一輪推理前,必須先把這些新增內容處理一遍,這個過程就是Prefill(預填充)。當Agent連續調用搜索、程式碼執行、檔案讀取等工具,文件、網頁和執行記錄不斷進入上下文,模型既要反覆處理新增輸入,又要儲存越來越大的KV Cache,還要在幾十萬甚至上百萬Token的歷史資訊中找出當前真正需要的內容。論文將長週期Agent推理的挑戰歸納為三點:降低Prefill計算量、減少KV Cache佔用、提高長上下文檢索準確率。
上一代HySparse已經做過一輪最佳化,它把全注意力層和稀疏注意力層交替排列,後面的稀疏層可以複用前一個全注意力層生成的KV Cache和選擇索引。但在Prefill階段,HySparse仍需依次執行全部網路層。HySparse2的關鍵變化是把Prefill的執行路徑縮短:處理長輸入時,模型跑完前半部分,就能完成後續推理所需的KV Cache構建。
實現這一點的核心是兩級KV共享。第一層叫KV Bridging:HySparse2把模型主體分成Self-Decoder和Cross-Decoder兩部分,前者由全注意力和滑動視窗注意力組成,後者由全注意力和稀疏注意力組成。在Cross-Decoder中,全注意力層生成K和V時,可以直接使用Self-Decoder對應全注意力層產生的隱藏狀態,後半部分無需再完整處理一次此前輸入的全部Token。第二層是KV Reuse:進入Cross-Decoder後,一個全注意力層生成的KV Cache和Token選擇結果,會繼續提供給後續多個稀疏注意力層複用。兩級共享疊加後,Cross-Decoder所需的KV Cache都可以根據Self-Decoder的隱藏狀態構建,Prefill執行完Self-Decoder即可退出。
在長上下文資訊的選擇方式上,HySparse2也做了調整。上一代HySparse採用Block級選擇,一次選取一整塊連續Token;HySparse2改為Token級選擇,可以直接從上下文不同位置尋找相關Token。這種變化更適合多輪Agent任務——一條真正有用的資訊可能藏在很早之前的一次工具返回中,Block級方案為了取出其中一個Token,還需要一併處理周圍的一整塊內容,Token級方案則可以直接選擇需要的位置。論文消融實驗顯示,在相同注意力預算下,Token級方案在RULER-v2、MRCR-v2和GraphWalks等長上下文檢索與圖推理測試上均取得更高得分。
HySparse2同時取消了Cross-Decoder中單獨的SWA分支,改為強制保留最近一段上下文。論文實驗中,每次固定保留最近128個Token,再從更早的上下文中選擇1024個Token,近期資訊和遠距離資訊因此能夠共用同一份KV Cache。以論文展示的49層模型為例,在Prefill與Decode分離部署時,Prefill節點只需要部署前25層,所需模型權重接近減半,且這一階段只需要執行一個全注意力層。
為了驗證HySparse2,小米團隊訓練了一組80B-A3B MoE模型,並與上一代HySparse以及MiMo-V2系列採用的Hybrid SWA進行比較。三組模型採用相同的資料和訓練計劃,僅注意力架構不同:首先使用約5000億Token進行預訓練,上下文長度為32K;隨後又使用約1000億Token進行輕量後訓練,並將上下文長度擴充套件至256K。
測試結果顯示,HySparse2較明顯的提升集中在長上下文檢索和Agent任務。經過後訓練後,相比HySparse,HySparse2在MRCR-v2和RULER-v2上的平均得分分別提高11.30和19.81個百分點;相比Hybrid SWA,則分別提高6.44和18.65個百分點。在256K上下文下,HySparse2的RULER-v2得分達到58.45,HySparse為32.61,Hybrid SWA為35.74。與此同時,HySparse2在論文測試的各個上下文長度下,AgentPPL和LongPPL均低於另外兩種架構。
計算和快取方面的差距更加直接。在100萬Token上下文下,HySparse2的Prefill FLOPs相比HySparse降至約34%,相比Hybrid SWA降至約20%。同一條件下,HySparse2的KV Cache佔用為2.69GB,HySparse為6.72GB,Hybrid SWA達到12.09GB,換算下來相比Hybrid SWA快取佔用降至約1/4.5。
在通用能力部分,小米團隊給出的結論相對剋制:三種架構在知識、推理和程式碼等能力上的整體表現大致相當,不同測試專案各有高低。例如,HySparse2在BBH和MMLU-Pro上的成績更高,HySparse則在DROP等專案上表現更好。相比這些常規測試,HySparse2在RULER、NoLiMa等長上下文任務上的提升更加突出。論文還通過消融實驗驗證了不同設計帶來的影響,例如取消獨立SWA分支、採用強制區域性視窗後,部分數學推理和MRCR-v2成績有所變化,但這一設計省去了額外投影引數和區域性KV Cache,同時讓Prefill可以在模型中途直接退出,小米團隊將其視為效率和模型能力之間的一項架構取捨。
論文由小米LLM-Core團隊完成,共有15位作者,羅福莉為通訊作者並標註為Team Lead。參考文獻中出現了多項業內成果,其中DeepSeek相關成果共有4項,包括DeepSeek-V2、DeepSeek-V3.2、DeepSeek-V4和DeepSeek-V4.1-Flash;OpenAI的gpt-oss模型卡以及GPT-4.1相關評測工作也在引用之列。
從MiMo-V2.6押注大規模RL擴充套件,到MiMo-V3提前亮出新的底層架構,小米MiMo團隊的模型迭代節奏還在加快。HySparse2通過兩級KV共享讓Prefill階段只需執行大約一半模型,同時進一步壓縮長上下文計算量和KV Cache佔用,並在多項長上下文、Agent任務上取得更高得分。這也讓MiMo-V3的一個技術方向提前變得清晰:面對越來越長、越來越多輪的Agent任務,小米正在繼續壓縮模型處理長輸入的計算與儲存成本。接下來,HySparse2會如何落到完整的MiMo-V3上,以及這套架構最終能帶來怎樣的實際表現,值得繼續關注。