研究機構SemiAnalysis於9月22日釋出一份深度技術報告,系統拆解大模型推理服務的底層架構。報告的核心判斷是:AI推理並非執行在單一伺服器上的整體程式,而是由多個專用工作節點池構成的迴圈系統,可細分為預填充(Prefill)、中間填充(Midfill)、解碼注意力(Decode Attention)和解碼專家(Decode Experts)四個工作階段,構成一座分工明確的"Token工廠"。
報告首先從混合專家(MoE)架構切入。過去業界習慣用引數量衡量模型規模,但MoE改變了比較邏輯——每次處理一個詞元時,模型不會讓全部引數參與計算,而是由"路由器"為每個詞元定位少數幾個最合適的專家模組。這帶來連鎖反應:哪些資料必須住在離計算最近的地方發生根本變化,記憶體、頻寬、儲存的價值權重被重新排列,排程複雜度也從線性增長變為指數級躍遷。
在推理流程上,使用者或代理發出請求後,排程層(如輝達Dynamo或Mooncake)將其放入佇列,分配給輸入填充工作節點,把使用者輸入連同歷史對話狀態轉化為新上下文,再交由解碼工作節點反覆讀取已積累狀態、逐步生成回答詞元。在智慧體場景下,這一流程還會與工具呼叫、外部搜尋交織,形成每小時可達數千次的對話輪次。
每輪對話產生的"記憶"以KV狀態形式儲存,被設計成不可變的資料塊,一旦生成便不再修改、只不斷追加,契合AI對話因果推進的特性。儲存採用層級設計:最高頻呼叫的即時資料住在GPU的HBM(高頻寬記憶體)裡,次高頻的中間態資料轉移到CPU的DRAM中轉,低頻歷史資料則推入SSD或網路儲存池。報告引用SemiAnalysis AgentX資料集的真實追蹤資料指出,智慧體對話中上下文增長極快,也會因壓縮行為大幅波動,領先AI公司被觀察到反覆壓縮上下文以維持在百萬詞元限制之內。成本結構上,報告明確指出HBM比DDR記憶體貴出數倍且供應受限,頻繁複用的通用資料塊應保留在共享CPU記憶體或近端快取,而非佔用昂貴的HBM。
報告最核心的貢獻之一,是強調四個階段對硬體的需求天差地別。預填充處理使用者首次請求的一整批新詞元,大量詞元共享權重載入,矩陣運算效率高、算術強度高,通常受計算能力約束而非記憶體頻寬。中間填充在智慧體工作流中日益重要,它在已有長快取字首上追加少量新詞元——字首可能已達數十萬詞元,新輸入僅數百至數千詞元,兼具解碼階段的大規模KV狀態讀取與預填充階段的權重複用特性,算術強度可達單詞元解碼的數百倍。解碼注意力每次前向傳播僅處理一個或少數幾個詞元,隨上下文增長,注意力讀取的資料量甚至可超過模型權重本身,是長上下文場景下最重的記憶體操作之一。解碼專家則是MoE特有環節,路由器根據當前詞元啟用值從龐大專家庫中選取少數專家執行計算,專家權重不攜帶查詢歷史,因而可在更廣泛的GPU範圍內分佈部署。
由此報告得出一個對硬體採購具有反直覺意義的結論:在許多推理場景下,頻寬比容量更能創造收益。資料在被處理時創造收益,在記憶體中閒置時只產生成本。一塊記憶體吞吐極高的加速器,即便容量較小,其生成詞元的速率也可能超過低頻寬高容量配置。在達到"夠用"的容量門檻之前,每增加一份記憶體都能顯著提升收益;越過門檻後曲線逐漸走平,繼續堆容量的邊際效益越來越低。報告給出一個2027年的實用設計基準:以每詞元約70KB的KV狀態、200萬詞元的聚合活躍上下文計算,單個流水線階段的KV狀態需求約140GB,加入雙緩衝後接近280GB;再疊加模型權重、啟用值、路由表和執行餘量,單階段約需400至500GB的本地快速記憶體。
排程層面,報告特別警告一種在大規模推理叢集中容易出現的系統性風險——延遲反饋震盪。預填充和中間填充可預測,但解碼是隨機的,沒人知道模型何時輸出終止符號。若解碼變慢,後續預填充請求就會積壓,系統可能過度補償、突然放入大量新任務,形成新一輪擁堵。報告提出的解法包括:在各階段之間設定就緒緩衝區、平滑化入場控制、分層控制時間尺度(微秒級硬體排程、毫秒級詞元流控制、秒級緩衝管理、分鐘級工作節點重配置)。報告認為,高互動性與高利用率並不天然矛盾,關鍵在於排程器要有足夠視野和反應速度。
架構路線上,報告呈現了分離式與聚合式兩種哲學的辯論。分離式主張為預填充和解碼分別配置最適合的硬體,任務來了由排程器決定送往哪台機器、完成後搬走KV快取;聚合式主張一次對話儘量在同一台機器完成,省去跨機搬運動輒數十GB KV快取的網路開銷,但要求單機同時擅長高強度計算與高頻寬記憶體訪問,而這兩種能力在硬體設計上往往存在取捨。報告認為,這場辯論的結論取決於能否造出同時具備極高計算密度和極高記憶體頻寬的"全能明星晶片",否則分離式仍是現有硬體條件下更務實的選擇。
報告最後通過SemiAnalysis推理模擬器,對Kimi K3模型在B200、B300與GB200系統上採用16至64塊GPU的不同配置進行了效能投影,覆蓋互動延遲、吞吐量、能耗與記憶體佔用四個維度,並註明這些均為模擬預測而非實測基準。解碼階段,GB200在延遲-吞吐權衡曲線的大部分割槽間表現領先;中間填充階段,GB200憑藉NVL72架構將擴充套件頻寬延伸至整個機架,在低首詞元延遲區間領先,B300在吞吐量導向端追平差距。記憶體佔用方面,大多數前沿配置的每GPU HBM峰值駐留量維持在80GB以下,支援了報告的核心論點:相較於最大化每塊加速器的HBM容量,頻寬管理與儲存編排往往具有更高的經濟價值。能耗方面,解碼階段因每個查詢需約1000次模型前向傳播而成為最大能耗來源,中間填充階段反而能耗最低。