海豚研究在一篇分析中指出,AI記憶體技術路線近期出現兩個方向相反的訊號:一方面HBM堆疊層數繼續加碼,從12層走向16層乃至20層;另一方面據SemiAnalysis,輝達下一代Rubin Ultra的HBM配置可能從16層一路砍到8層,同時以NAND快閃記憶體顆粒為基礎的HBF(高頻寬快閃記憶體)也在試圖從HBM手中分走一部分容量需求。

文章圍繞容量、頻寬、成本三條線索展開。擴大記憶體容量目前有兩條並行路徑:一是把單顆記憶體做得更強,代價是更復雜的工藝、更高成本和可能更低的良率;二是以數量取勝,用不同規格的產品匹配不同層級的需求。

在單顆效能路徑上,最直接的做法是繼續增加堆疊層數。但HBM與XPU共同封裝、共用底座和頂蓋,記憶體堆總高度受限:HBM3E及之前規範上限為720um,HBM4放寬到775um。限高之下要塞進更多層,只能削薄單層DRAM顆粒、壓縮層間空隙,甚至去掉微凸點改用銅銅鍵合。更精密的工藝意味著更高成本和更低良率,削薄後的矽片更易翹曲,層間散熱和絕緣填充也更難。另一條捷徑是把GPU下方的中介層墊高,讓記憶體堆可用高度提升到約800um,但按每層寬度估算最多隻能再多放2層。

以量取勝的路徑則是增加記憶體數量。由於緊貼XPU的位置有限,新增記憶體大機率只能放在後排,代價是頻寬更低。後排可以用HBM,也可以用普通DDR乃至基於NAND的HBF。但後排不能無限加,頻寬是最大瓶頸:後排記憶體的資料需前排記憶體中轉,整個多排記憶體的最大頻寬受限於首排HBM與XPU之間的頻寬。

HBF的結構基本是HBM的復刻,多層堆疊、TSV貫通、與XPU共同封裝,只是把DRAM顆粒換成NAND顆粒。文章提到,計劃於2026年末至2027年初推出的HBF Gen1(16層堆疊),單堆容量可達512GB,而16層HBM4只有48GB;HBF單GB價格據調研可能只有HBM的1/5至1/10左右。據公司披露,HBF Gen1讀取頻寬可達1.6TB/s,約為HBM4規範最高頻寬的55%。但NAND天生延遲高、寫入慢、按塊讀取、擦寫壽命有限,註定無法取代HBM,只適合不需要頻繁讀寫的資料,如全量模型引數、壓縮後的上下文快取、暫未呼叫的MoE專家引數等。

文章認為,最可能的遠期解是多級、混合的儲存架構:XPU一側共同封裝HBM提供高傳輸速度,另一側封裝HBF提供更大容量。更遠期的HBM7設想中,還會再加一層走PCIe協議的池化儲存,讓每顆XPU都能共享呼叫整個系統的DRAM、SSD和HBF。

針對HBM層數可能不增反減的市場熱議,文章列出三個原因。其一是DRAM晶圓產能有限:目前要產出同等GB容量,HBM消耗的DRAM晶圓本已是常規DRAM的3至4倍,堆疊層數繼續加高對晶圓損耗更大,同樣產線下能產出的儲存總容量反而變少。其二是互聯規模擴大,系統總容量不降反升:B300單顆GPU配8顆12層HBM3E、共288GB,一個機櫃最多互聯72顆,總容量約20TB;而Rubin Ultra單顆GPU即便只配8顆8層HBM、共192GB,最多可互聯576顆,系統共享總容量達110TB。其三是降層數可壓降工藝難度和成本。

但降層數也帶來新問題:瓶頸從記憶體廠自身擴產速度,轉向能從台積電(以及三星、Intel)鎖定多少共同封裝產能;同時對互聯技術提出更高要求,包括超量GPU互聯下的HBM儲存共享、用CXL交換晶片做DRAM記憶體池化,以及輝達通過CMX產品做NAND池化平台。

文章還討論了封裝與頻寬兩個關鍵要素。HBM的高頻寬離不開與XPU共同封裝在矽中介層上,這一環節目前主要依賴台積電的CoWoS工藝。CoWoS有S、R、L三個變種,其中CoWoS-L以RDL為主體,只在HBM與XPU連線處嵌入小塊矽橋,單片中介層面積已能做到單次曝光的5.5倍,輝達從B200系列起已採用。據投行統計預測,CoWoS-L使用佔比已在60%以上,且CoWoS產能增長快於DRAM晶圓產能。

在頻寬方面,單個記憶體頻寬等於位寬乘以速率。文章指出,位寬和速率看似攜手,實則相互制約。從歷代HBM看,HBM1到HBM3E位寬一直是1024位,頻寬提升幾乎全靠速率,但速率提升也在放緩;而到位寬翻倍的HBM4,一開始標準速率原地踏步,後續才有所提升。目前瓶頸更多在外部頻寬,難點在基底層和中介層的設計與製造。

整體來看,這篇文章屬於海豚研究對AI記憶體技術路線的分析評論,核心判斷是:HBM層數是否繼續堆高,取決於DRAM晶圓產能、共同封裝產能與頻寬提升速度三者的博弈;而HBF等NAND方案更可能以補充角色進入混合儲存架構,而非直接取代HBM。