在剛剛落幕的2026世界人工智慧大會(WAIC)上,無問芯穹首次公開了其在大模型推理系統架構中的新突破——跨叢集異構推理架構PDD(Prefill-RelayDecode-MainDecode)。該架構的核心思路是用低成本的廣域網乙太網路串聯多地已建成的同構資料中心,並將傳統的PD分離鏈路“P-D”創新解構為“P-RLD-MD”三級分離式推理架構。實測資料顯示,該架構實現了首Token延遲降低51.5%,單Token成本降低37.5%。
行業共識認為,大語言模型推理存在Prefill(預填充,計算密集型)和Decode(解碼,訪存密集型)兩個特性迥異的階段。理論上最理想的解法是“異構分離”路線:讓算力強的卡負責Prefill,讓視訊記憶體頻寬高的卡負責Decode。但要在同一個集群裡構建大規模異構算力資源,不僅採購成本極其高昂,且一旦模型架構變化,固定配比的硬體容易出現部分閒置。
無問芯穹團隊在前期研究中發現了幾個關鍵“底層規律”。首先,晶片效能極度“偏科”:以8卡的某旗艦高效能GPU為基線,某廠商的E晶片在處理計算密集的Prefill階段時只能達到基線約81%的效能,但在訪存密集的Decode階段卻能爆發出基線210%的效能。其次,團隊發現輸入請求的命中率分佈極度偏斜:約70%-80%的請求命中率在95%以上,只有極少部分低命中率請求攜帶巨大的KV Cache資料包。在20Gbps跨叢集專線上的微基準測試顯示,真實偏斜分佈下P50傳輸延遲極低(僅248ms),而均勻分佈下P50延遲飆升到1210ms,引發嚴重排隊阻塞。
基於上述洞察,無問芯穹提出了PDD架構。傳統PD分離只有Prefill和Decode兩層,而團隊在中間插入了一個“中繼站”——RelayDecode(RLD)例項。其核心思想是:用本地的RLD算力精準掩蓋跨叢集那極少數低命中率請求的網路延遲。使用者請求先被路由到同機房的RLD例項,RLD通過RDMA從同機房Prefill例項拿到KV Cache後立刻開始吐字,使用者感覺不到後台乙太網路幾秒到十幾秒的慢速傳輸。當遠端MD例項收到完整KV Cache後,解碼任務無縫從RLD交接給MD,由MD完成後續大部分吐字工作。
交接環節的最大工程難題在於:當MD例項準備好後,如何無縫接管RLD正在進行的解碼任務?無問芯穹提出了反直覺但高效的機制——Extend-Decode Handoff(擴充套件解碼交接)。RLD不傳輸龐大的KV Cache,只把生成的“Token ID”傳給MD,傳輸幾個Token ID僅幾KB資料量,網路開銷幾乎為零。MD收到Token ID後,利用“Extend-Decode”技術在本地重新計算這些Token對應的KV Cache,同時生成下一個新Token。實測顯示,MD端重算100個Token的KV Cache平均耗時僅305.2ms,最大延遲321.4ms,標準差極小(4.8ms);而傳統乙太網路傳KV Cache平均185.4ms,但峰值可達512.6ms,標準差高達96.3ms,還額外增加24.5ms的H2D/D2H開銷。通過“只傳Token,本地重算”,團隊把一個受網路波動影響極大的操作變成了確定性、可預測的本地計算。
在DeepSeek-V4-pro模型上使用真實Agentic工作負載Trace的測試顯示:傳統PD分離架構中,使用者TTFT的P90延遲飆升至18.3秒,P99逼近30秒;而PDD的P90 TTFT降至9.8秒(降低約46%),P99降至14.4秒。RLD例項僅承擔系統6.2%的Token生成任務(約27萬個Token),遠端MD例項包攬93.8%的重活(約412萬個Token),負載差異高達15.2倍。
在成本收益核算對比中,無問芯穹團隊將PDD與單機房同構某旗艦高效能GPU叢集(IDC-PD)對比。在嚴格的TTFT約束下(P90 TTFT 10s,P99 TTFT 15s),結果顯示:PDD在總成本下降約3.5%~7.1%的前提下,請求的有效吞吐量(RPS Goodput)提升27.8%,最終價效比(Benefit-Cost Ratio)提升高達37.5%。
PDD架構承載著無問芯穹對下一代模型即服務(MaaS)基礎設施的核心設計理念——極簡區域性異構+靈活遠端分離。未來,主算力中心只需保留極小比例的“接力手”,就能把龐大的解碼任務分發到全國乃至全球的低成本算力節點上。多種異構算力可零散、低成本地分散在多個叢集,通過可擴充套件性極強的跨域乙太網路構成複雜拓撲的推理基建。面對模型迭代帶來的PD配比變化,這種跨叢集範式也能大幅盤活存量算力,壓低資源空置比例。