是什么
混合专家(Mixture of Experts,MoE)是一种大模型架构:把网络的部分层拆成许多个并列的「专家」子网络,再由一个「路由器」(router)为每个 token 只挑选其中少数几个专家来计算。于是模型的「总参数量」可以做得非常大,但每次推理实际「激活」的参数只是其中一小部分——这被称为稀疏激活。DeepSeek、通义千问、NVIDIA Nemotron 等多个系列都采用了 MoE。
为什么重要
MoE 的意义在于解耦了「模型容量」与「推理成本」。传统稠密(Dense)模型参数越大、每次推理就越贵;MoE 让模型可以拥有海量总参数(容纳更多知识)却只按激活参数付出算力,从而在同等推理成本下达到更高质量,或在同等质量下大幅降低成本。这也是近年开源旗舰模型能把价格不断打低的技术原因之一。
2026 年的最新进展
2026 年 2 月开源的 Qwen3.5-397B-A17B 把稀疏度推到了新档位:3970 亿总参数、单 token 只激活 170 亿(约 4%),60 层里共设 512 个专家,每个 token 走 10 个路由专家加 1 个共享专家。NVIDIA 2026 年的两款新模型激活比例则在 10% 一线:6 月的 Nemotron 3 Ultra 为 5500 亿总参数、550 亿激活,4 月的 Nemotron 3 Super 为 1200 亿总参数、120 亿激活。更值得注意的是,2026 年这批 MoE 几乎都不再是「纯 Transformer 加 MoE」——Qwen3.5 把四分之三的层换成线性注意力,Nemotron 3 系列改用 Mamba 层与注意力层的混合设计,MoE 已成开源旗舰的默认底盘。
在 AI 产业链中的位置
MoE 是模型层的架构创新,直接改写芯片与基础设施层的账:它降低单 token 的计算量,却对显存与高速互联提出更高要求——众多专家都要驻留显存、并在多卡之间调度。向上,它让应用层能用得起更大、更强的模型。