是什麼
混合專家(Mixture of Experts,MoE)是一種大模型架構:把網路的部分層拆成許多個並列的「專家」子網路,再由一個「路由器」(router)為每個 token 只挑選其中少數幾個專家來計算。於是模型的「總引數量」可以做得非常大,但每次推理實際「啟用」的引數只是其中一小部分——這被稱為稀疏啟用。DeepSeek、Mixtral、通義千問等多個系列都採用了 MoE。
為什麼重要
MoE 的意義在於解耦了「模型容量」與「推理成本」。傳統稠密(Dense)模型引數越大、每次推理就越貴;MoE 讓模型可以擁有海量總引數(容納更多知識)卻只按啟用引數付出算力,從而在同等推理成本下達到更高質量,或在同等質量下大幅降低成本。這也是近年開源旗艦模型能把價格不斷打低的技術原因之一。
在 AI 產業鏈中的位置
MoE 是模型層的架構創新,直接改寫晶片與基礎設施層的賬:它降低單 token 的計算量,卻對視訊記憶體與高速互聯提出更高要求——眾多專家都要駐留視訊記憶體、並在多卡之間排程。向上,它讓應用層能用得起更大、更強的模型。