英伟达悄然重启了一项一度被市场认为已经放弃的芯片项目,目标直指AI推理成本较高的预填充(Prefill)环节。知名分析师郭明錤最新产业调查显示,英伟达已重新启动AI推理预填充加速GPU项目“Rubin CPX”,并对产品设计进行大幅调整。按照目前规划,新版Rubin CPX预计于2027年第一季度开始生产。

此次项目重启释放出一个明确信号:英伟达正在加码解决AI推理阶段的预填充性能与成本瓶颈。随着大模型上下文长度持续增加,预填充阶段需要处理大量输入信息并生成KV Cache,其效率直接影响AI推理的整体成本和部署经济性。郭明錤称,目前超过50%的AI推理工作负载来自输入上下文处理及KV Cache构建。

新版Rubin CPX的核心规格较此前方案出现明显变化。在算力和功耗方面,新版CPX的性能已接近标准Rubin GPU,单卡最高功耗同样达到2300瓦。内存方面,新版CPX改用168GB HBM4显存,较此前方案的128GB GDDR7明显升级,但仍低于标准Rubin GPU的288GB HBM4。按照郭明錤的说法,8卡CPX计算托盘的HBM4容量合计约1.34TB,能够覆盖大多数长上下文预填充工作负载及对应的KV Cache需求。这意味着,Rubin CPX并非单纯追求更高的通用算力,而是针对长上下文场景对显存容量和预填充效率进行了重新设计。

机架架构也是此次调整的重点。此前方案中,CPX计划与Rubin GPU共享机架;新版则改为采用独立的MGX ETL机架,从而允许客户根据实际需求单独扩展CPX算力。具体来看,客户可以选择64、128、192或256张CPX GPU的部署规模。每64张CPX GPU构成一个机架模块,包括8个计算托盘,每个托盘搭载8张CPX GPU,同时配备一个交换机托盘。模块化设计意味着,客户无需按照固定的大规模Rubin机架进行采购,可以根据预填充负载的实际需求灵活增加CPX算力。

在互联架构上,Rubin CPX采用分层设计,在性能与成本之间进行取舍。在单个计算托盘内部,8张CPX GPU通过NVLink进行Scale-up扩展。每张CPX GPU的NVLink带宽为1至1.5TB/s,低于标准Rubin GPU的3.6TB/s。在托盘之间以及机架模块内部的Scale-out层面,CPX采用Spectrum-6以太网全铜L1链路;跨机架模块连接时,则通过各模块的Spectrum-6交换机,经OSFP光纤链路完成互联。相比完全依赖高带宽GPU互联的方案,这种分层架构更强调针对预填充场景进行成本优化。

Rubin CPX并不是独立运行的通用GPU,而是作为预填充加速器与Vera Rubin NVL72配套使用。按照郭明錤的说法,英伟达推荐CPX与Rubin GPU按照1:1的比例部署:CPX负责预填充阶段的计算并生成KV Cache,随后通过以太网RDMA将KV Cache传输至Rubin GPU,由后者完成后续解码。从产品定位来看,Rubin CPX的核心并不是取代标准Rubin GPU,而是将AI推理流程进一步拆分,让不同GPU分别承担预填充和解码任务。郭明錤将其定位为“长上下文预填充的最佳性价比方案”。

随着AI模型上下文窗口不断扩大,预填充阶段的计算量和KV Cache规模持续增长,英伟达此次重启CPX项目,或正是试图通过专用硬件和异构部署方式,进一步降低长上下文推理的成本。对于AI产业投资者而言,这一动向表明英伟达在推理环节的硬件布局更趋精细化,可能影响未来AI算力采购与部署的格局。