小米MiMo大模型负责人罗福莉在9月23日晚发文,提前披露了下一代模型MiMo-V3的新架构,率先登场的是核心组件HySparse2,相关技术论文同步公布。这是距离小米上一轮模型更新仅两天后的又一次技术动作——9月22日,小米大模型团队刚发布并开源Xiaomi MiMo-V2.6系列,并预告后续将逐步开放MiMo-V2.6-Pro-UltraSpeed。
HySparse2要解决的问题与Agent的工作模式直接相关。在Agent多轮任务中,模型生成的动作往往很短,但工具返回的内容可能很长:一句搜索指令之后,搜索引擎可能返回一篇长文档;一次代码调用之后,代码工具可能返回大量运行日志。模型在下一轮推理前,必须先把这些新增内容处理一遍,这个过程就是Prefill(预填充)。当Agent连续调用搜索、代码执行、文件读取等工具,文档、网页和运行记录不断进入上下文,模型既要反复处理新增输入,又要保存越来越大的KV Cache,还要在几十万甚至上百万Token的历史信息中找出当前真正需要的内容。论文将长周期Agent推理的挑战归纳为三点:降低Prefill计算量、减少KV Cache占用、提高长上下文检索准确率。
上一代HySparse已经做过一轮优化,它把全注意力层和稀疏注意力层交替排列,后面的稀疏层可以复用前一个全注意力层生成的KV Cache和选择索引。但在Prefill阶段,HySparse仍需依次执行全部网络层。HySparse2的关键变化是把Prefill的执行路径缩短:处理长输入时,模型跑完前半部分,就能完成后续推理所需的KV Cache构建。
实现这一点的核心是两级KV共享。第一层叫KV Bridging:HySparse2把模型主体分成Self-Decoder和Cross-Decoder两部分,前者由全注意力和滑动窗口注意力组成,后者由全注意力和稀疏注意力组成。在Cross-Decoder中,全注意力层生成K和V时,可以直接使用Self-Decoder对应全注意力层产生的隐藏状态,后半部分无需再完整处理一次此前输入的全部Token。第二层是KV Reuse:进入Cross-Decoder后,一个全注意力层生成的KV Cache和Token选择结果,会继续提供给后续多个稀疏注意力层复用。两级共享叠加后,Cross-Decoder所需的KV Cache都可以根据Self-Decoder的隐藏状态构建,Prefill执行完Self-Decoder即可退出。
在长上下文信息的选择方式上,HySparse2也做了调整。上一代HySparse采用Block级选择,一次选取一整块连续Token;HySparse2改为Token级选择,可以直接从上下文不同位置寻找相关Token。这种变化更适合多轮Agent任务——一条真正有用的信息可能藏在很早之前的一次工具返回中,Block级方案为了取出其中一个Token,还需要一并处理周围的一整块内容,Token级方案则可以直接选择需要的位置。论文消融实验显示,在相同注意力预算下,Token级方案在RULER-v2、MRCR-v2和GraphWalks等长上下文检索与图推理测试上均取得更高得分。
HySparse2同时取消了Cross-Decoder中单独的SWA分支,改为强制保留最近一段上下文。论文实验中,每次固定保留最近128个Token,再从更早的上下文中选择1024个Token,近期信息和远距离信息因此能够共用同一份KV Cache。以论文展示的49层模型为例,在Prefill与Decode分离部署时,Prefill节点只需要部署前25层,所需模型权重接近减半,且这一阶段只需要执行一个全注意力层。
为了验证HySparse2,小米团队训练了一组80B-A3B MoE模型,并与上一代HySparse以及MiMo-V2系列采用的Hybrid SWA进行比较。三组模型采用相同的数据和训练计划,仅注意力架构不同:首先使用约5000亿Token进行预训练,上下文长度为32K;随后又使用约1000亿Token进行轻量后训练,并将上下文长度扩展至256K。
测试结果显示,HySparse2较明显的提升集中在长上下文检索和Agent任务。经过后训练后,相比HySparse,HySparse2在MRCR-v2和RULER-v2上的平均得分分别提高11.30和19.81个百分点;相比Hybrid SWA,则分别提高6.44和18.65个百分点。在256K上下文下,HySparse2的RULER-v2得分达到58.45,HySparse为32.61,Hybrid SWA为35.74。与此同时,HySparse2在论文测试的各个上下文长度下,AgentPPL和LongPPL均低于另外两种架构。
计算和缓存方面的差距更加直接。在100万Token上下文下,HySparse2的Prefill FLOPs相比HySparse降至约34%,相比Hybrid SWA降至约20%。同一条件下,HySparse2的KV Cache占用为2.69GB,HySparse为6.72GB,Hybrid SWA达到12.09GB,换算下来相比Hybrid SWA缓存占用降至约1/4.5。
在通用能力部分,小米团队给出的结论相对克制:三种架构在知识、推理和代码等能力上的整体表现大致相当,不同测试项目各有高低。例如,HySparse2在BBH和MMLU-Pro上的成绩更高,HySparse则在DROP等项目上表现更好。相比这些常规测试,HySparse2在RULER、NoLiMa等长上下文任务上的提升更加突出。论文还通过消融实验验证了不同设计带来的影响,例如取消独立SWA分支、采用强制局部窗口后,部分数学推理和MRCR-v2成绩有所变化,但这一设计省去了额外投影参数和局部KV Cache,同时让Prefill可以在模型中途直接退出,小米团队将其视为效率和模型能力之间的一项架构取舍。
论文由小米LLM-Core团队完成,共有15位作者,罗福莉为通讯作者并标注为Team Lead。参考文献中出现了多项业内成果,其中DeepSeek相关成果共有4项,包括DeepSeek-V2、DeepSeek-V3.2、DeepSeek-V4和DeepSeek-V4.1-Flash;OpenAI的gpt-oss模型卡以及GPT-4.1相关评测工作也在引用之列。
从MiMo-V2.6押注大规模RL扩展,到MiMo-V3提前亮出新的底层架构,小米MiMo团队的模型迭代节奏还在加快。HySparse2通过两级KV共享让Prefill阶段只需运行大约一半模型,同时进一步压缩长上下文计算量和KV Cache占用,并在多项长上下文、Agent任务上取得更高得分。这也让MiMo-V3的一个技术方向提前变得清晰:面对越来越长、越来越多轮的Agent任务,小米正在继续压缩模型处理长输入的计算与存储成本。接下来,HySparse2会如何落到完整的MiMo-V3上,以及这套架构最终能带来怎样的实际表现,值得继续关注。