在刚刚落幕的2026世界人工智能大会(WAIC)上,无问芯穹首次公开了其在大模型推理系统架构中的新突破——跨集群异构推理架构PDD(Prefill-RelayDecode-MainDecode)。该架构的核心思路是用低成本的广域网以太网串联多地已建成的同构数据中心,并将传统的PD分离链路“P-D”创新解构为“P-RLD-MD”三级分离式推理架构。实测数据显示,该架构实现了首Token延迟降低51.5%,单Token成本降低37.5%。

行业共识认为,大语言模型推理存在Prefill(预填充,计算密集型)和Decode(解码,访存密集型)两个特性迥异的阶段。理论上最理想的解法是“异构分离”路线:让算力强的卡负责Prefill,让显存带宽高的卡负责Decode。但要在同一个集群里构建大规模异构算力资源,不仅采购成本极其高昂,且一旦模型架构变化,固定配比的硬件容易出现部分闲置。

无问芯穹团队在前期研究中发现了几个关键“底层规律”。首先,芯片性能极度“偏科”:以8卡的某旗舰高性能GPU为基线,某厂商的E芯片在处理计算密集的Prefill阶段时只能达到基线约81%的性能,但在访存密集的Decode阶段却能爆发出基线210%的性能。其次,团队发现输入请求的命中率分布极度偏斜:约70%-80%的请求命中率在95%以上,只有极少部分低命中率请求携带巨大的KV Cache数据包。在20Gbps跨集群专线上的微基准测试显示,真实偏斜分布下P50传输延迟极低(仅248ms),而均匀分布下P50延迟飙升到1210ms,引发严重排队阻塞。

基于上述洞察,无问芯穹提出了PDD架构。传统PD分离只有Prefill和Decode两层,而团队在中间插入了一个“中继站”——RelayDecode(RLD)实例。其核心思想是:用本地的RLD算力精准掩盖跨集群那极少数低命中率请求的网络延迟。用户请求先被路由到同机房的RLD实例,RLD通过RDMA从同机房Prefill实例拿到KV Cache后立刻开始吐字,用户感觉不到后台以太网几秒到十几秒的慢速传输。当远端MD实例收到完整KV Cache后,解码任务无缝从RLD交接给MD,由MD完成后续大部分吐字工作。

交接环节的最大工程难题在于:当MD实例准备好后,如何无缝接管RLD正在进行的解码任务?无问芯穹提出了反直觉但高效的机制——Extend-Decode Handoff(扩展解码交接)。RLD不传输庞大的KV Cache,只把生成的“Token ID”传给MD,传输几个Token ID仅几KB数据量,网络开销几乎为零。MD收到Token ID后,利用“Extend-Decode”技术在本地重新计算这些Token对应的KV Cache,同时生成下一个新Token。实测显示,MD端重算100个Token的KV Cache平均耗时仅305.2ms,最大延迟321.4ms,标准差极小(4.8ms);而传统以太网传KV Cache平均185.4ms,但峰值可达512.6ms,标准差高达96.3ms,还额外增加24.5ms的H2D/D2H开销。通过“只传Token,本地重算”,团队把一个受网络波动影响极大的操作变成了确定性、可预测的本地计算。

DeepSeek-V4-pro模型上使用真实Agentic工作负载Trace的测试显示:传统PD分离架构中,用户TTFT的P90延迟飙升至18.3秒,P99逼近30秒;而PDD的P90 TTFT降至9.8秒(降低约46%),P99降至14.4秒。RLD实例仅承担系统6.2%的Token生成任务(约27万个Token),远端MD实例包揽93.8%的重活(约412万个Token),负载差异高达15.2倍。

在成本收益核算对比中,无问芯穹团队将PDD与单机房同构某旗舰高性能GPU集群(IDC-PD)对比。在严格的TTFT约束下(P90 TTFT 10s,P99 TTFT 15s),结果显示:PDD在总成本下降约3.5%~7.1%的前提下,请求的有效吞吐量(RPS Goodput)提升27.8%,最终性价比(Benefit-Cost Ratio)提升高达37.5%。

PDD架构承载着无问芯穹对下一代模型即服务(MaaS)基础设施的核心设计理念——极简局部异构+灵活远端分离。未来,主算力中心只需保留极小比例的“接力手”,就能把庞大的解码任务分发到全国乃至全球的低成本算力节点上。多种异构算力可零散、低成本地分散在多个集群,通过可扩展性极强的跨域以太网构成复杂拓扑的推理基建。面对模型迭代带来的PD配比变化,这种跨集群范式也能大幅盘活存量算力,压低资源空置比例。