是什麼

混合專家(Mixture of Experts,MoE)是一種大模型架構:把網路的部分層拆成許多個並列的「專家」子網路,再由一個「路由器」(router)為每個 token 只挑選其中少數幾個專家來計算。於是模型的「總引數量」可以做得非常大,但每次推理實際「啟用」的引數只是其中一小部分——這被稱為稀疏啟用。DeepSeek、通義千問、NVIDIA Nemotron 等多個系列都採用了 MoE。

為什麼重要

MoE 的意義在於解耦了「模型容量」與「推理成本」。傳統稠密(Dense)模型引數越大、每次推理就越貴;MoE 讓模型可以擁有海量總引數(容納更多知識)卻只按啟用引數付出算力,從而在同等推理成本下達到更高質量,或在同等質量下大幅降低成本。這也是近年開源旗艦模型能把價格不斷打低的技術原因之一。

2026 年的最新進展

2026 年 2 月開源的 Qwen3.5-397B-A17B 把稀疏度推到了新檔位:3970 億總引數、單 token 只啟用 170 億(約 4%),60 層裡共設 512 個專家,每個 token 走 10 個路由專家加 1 個共享專家。NVIDIA 2026 年的兩款新模型啟用比例則在 10% 一線:6 月的 Nemotron 3 Ultra 為 5500 億總引數、550 億啟用,4 月的 Nemotron 3 Super 為 1200 億總引數、120 億啟用。更值得注意的是,2026 年這批 MoE 幾乎都不再是「純 Transformer 加 MoE」——Qwen3.5 把四分之三的層換成線性注意力,Nemotron 3 系列改用 Mamba 層與注意力層的混合設計,MoE 已成開源旗艦的預設底盤。

在 AI 產業鏈中的位置

MoE 是模型層的架構創新,直接改寫晶片與基礎設施層的賬:它降低單 token 的計算量,卻對視訊記憶體與高速互聯提出更高要求——眾多專家都要駐留視訊記憶體、並在多卡之間排程。向上,它讓應用層能用得起更大、更強的模型。

在大模型庫查

採用 MoE 的開源旗艦模型可在開源大模型切片裡找到;各模型的價格與上下文見大模型庫總表。