輝達悄然重啟了一項一度被市場認為已經放棄的晶片專案,目標直指AI推理成本較高的預填充(Prefill)環節。知名分析師郭明錤最新產業調查顯示,輝達已重新啟動AI推理預填充加速GPU專案“Rubin CPX”,並對產品設計進行大幅調整。按照目前規劃,新版Rubin CPX預計於2027年第一季度開始生產。

此次專案重啟釋放出一個明確訊號:輝達正在加碼解決AI推理階段的預填充效能與成本瓶頸。隨著大模型上下文長度持續增加,預填充階段需要處理大量輸入資訊並生成KV Cache,其效率直接影響AI推理的整體成本和部署經濟性。郭明錤稱,目前超過50%的AI推理工作負載來自輸入上下文處理及KV Cache構建。

新版Rubin CPX的核心規格較此前方案出現明顯變化。在算力和功耗方面,新版CPX的效能已接近標準Rubin GPU,單卡最高功耗同樣達到2300瓦。記憶體方面,新版CPX改用168GB HBM4視訊記憶體,較此前方案的128GB GDDR7明顯升級,但仍低於標準Rubin GPU的288GB HBM4。按照郭明錤的說法,8卡CPX計算托盤的HBM4容量合計約1.34TB,能夠覆蓋大多數長上下文預填充工作負載及對應的KV Cache需求。這意味著,Rubin CPX並非單純追求更高的通用算力,而是針對長上下文場景對視訊記憶體容量和預填充效率進行了重新設計。

機架架構也是此次調整的重點。此前方案中,CPX計劃與Rubin GPU共享機架;新版則改為採用獨立的MGX ETL機架,從而允許客戶根據實際需求單獨擴充套件CPX算力。具體來看,客戶可以選擇64、128、192或256張CPX GPU的部署規模。每64張CPX GPU構成一個機架模組,包括8個計算托盤,每個托盤搭載8張CPX GPU,同時配備一個交換機托盤。模組化設計意味著,客戶無需按照固定的大規模Rubin機架進行採購,可以根據預填充負載的實際需求靈活增加CPX算力。

在互聯架構上,Rubin CPX採用分層設計,在效能與成本之間進行取捨。在單個計算托盤內部,8張CPX GPU通過NVLink進行Scale-up擴充套件。每張CPX GPU的NVLink頻寬為1至1.5TB/s,低於標準Rubin GPU的3.6TB/s。在托盤之間以及機架模組內部的Scale-out層面,CPX採用Spectrum-6乙太網路全銅L1鏈路;跨機架模組連線時,則通過各模組的Spectrum-6交換機,經OSFP光纖鏈路完成互聯。相比完全依賴高頻寬GPU互聯的方案,這種分層架構更強調針對預填充場景進行成本最佳化。

Rubin CPX並不是獨立執行的通用GPU,而是作為預填充加速器與Vera Rubin NVL72配套使用。按照郭明錤的說法,輝達推薦CPX與Rubin GPU按照1:1的比例部署:CPX負責預填充階段的計算並生成KV Cache,隨後通過乙太網路RDMA將KV Cache傳輸至Rubin GPU,由後者完成後續解碼。從產品定位來看,Rubin CPX的核心並不是取代標準Rubin GPU,而是將AI推理流程進一步拆分,讓不同GPU分別承擔預填充和解碼任務。郭明錤將其定位為“長上下文預填充的最佳價效比方案”。

隨著AI模型上下文視窗不斷擴大,預填充階段的計算量和KV Cache規模持續增長,輝達此次重啟CPX專案,或正是試圖通過專用硬體和異構部署方式,進一步降低長上下文推理的成本。對於AI產業投資者而言,這一動向表明輝達在推理環節的硬體佈局更趨精細化,可能影響未來AI算力採購與部署的格局。