AI 記憶體正站在一個岔路口:一邊是 HBM 路線圖繼續加碼,堆疊層數從 12 層走向 16 層乃至 20 層;另一邊,據 SemiAnalysis,輝達下一代 Rubin Ultra 的 HBM 可能從 16 層一路砍到 8 層,單顆 GPU 的 HBM 總容量或從 768GB 砍半再砍半至 192GB。與此同時,以 NAND 快閃記憶體顆粒為基礎的 HBF 也在試圖從 HBM 手中分走一部分容量需求。這些訊號看似矛盾,實則指向同一個約束:容量、頻寬與成本三者難以兼得。

擴大記憶體容量,業內大致有兩條並行路徑。第一條是突破工藝上限,把單顆記憶體做得更強,最直接的辦法是繼續增加堆疊層數。但 HBM 與 XPU 共同封裝、共用底座和頂蓋,記憶體堆總高度受限:HBM3E 及之前規範上限為 720um,HBM4 放寬到 775um。限高之下要加層,只能削薄單層 DRAM 顆粒、壓縮層間空隙,甚至去掉微凸點改用銅銅鍵合。代價是矽片強度下降、散熱與絕緣填充更難、TSV 需要更密更細,良率與成本壓力同步上升。另一種取巧辦法是把 GPU 下方的中介層墊高,在頂部齊平的前提下讓記憶體堆可用高度提升到約 800um,但能擠出的空間有限,最多再多放兩層。

第二條路徑是以量取勝,增加記憶體數量。由於緊貼 XPU 的位置有限,新增記憶體大機率只能放在後排,省去加密堆疊的工藝難題,代價是後排頻寬勢必更低。後排用什麼記憶體、怎麼封裝都有選擇:規格上可用普通 DDR 乃至基於 NAND 的 HBF,封裝上可放在矽中介層、基板或 PCB 上。但後排不能無限加,頻寬是最大瓶頸——後排資料需前排記憶體中轉,整個多排記憶體的最大頻寬受限於首排 HBM 與 XPU 之間的頻寬。

HBF 是降低單位儲存價格的重要選項。它的結構基本是 HBM 的復刻:多層堆疊、TSV 貫通、與 XPU 共同封裝,只是把 DRAM 顆粒換成 NAND 顆粒。計劃於 2026 年末至 27 年初推出的 HBF Gen1(16 層堆疊),單堆容量可達 512GB,而 16 層 HBM4 只有 48GB;HBF 單 GB 價格據調研可能只有 HBM 的 1/5 至 1/10 左右,且 NAND 顆粒功耗和散熱需求相對更低。據公司披露,HBF Gen1 讀取頻寬可達 1.6TB/s,約為 HBM4 規範最高頻寬的 55%。但 NAND 天生延遲高、寫入慢、按塊讀取、擦寫壽命有限,註定無法取代 HBM,只適合不需要頻繁讀寫的資料,如全量模型引數、壓縮後的上下文快取、暫未呼叫的 MoE 專家引數等。

由此,多級、混合的儲存架構被視為最可能的遠期解。例如在 XPU 一側共同封裝 HBM 提供高傳輸速度,負責高頻讀寫資料;另一側封裝 HBF 提供更大容量,負責相對低頻的資料。更遠期的 HBM7 設想中,還會再加一層走 PCIe 協議的池化儲存,讓每顆 XPU 都能共享呼叫整個系統的 DRAM、SSD 和 HBF。

HBM 層數可能不增反減,背後有三個原因。其一,DRAM 晶圓產能有限:目前要產出同等 GB 容量,HBM 消耗的 DRAM 晶圓本已是常規 DRAM 的 3 至 4 倍,堆疊層數繼續加高對晶圓損耗更大,而 DRAM 新增產能需要時間,據投行預測 2024 至 2026 年晶圓產能增長有限,2027 年才會有較多釋放。其二,互聯規模擴大使系統總容量不降反升:B300 單顆 GPU 配 8 顆 12 層 HBM3E、共 288GB,一個機櫃最多互聯 72 顆,總容量約 20TB;而 Rubin Ultra 單顆 GPU 即便只配 8 顆 8 層 HBM、共 192GB,最多可互聯 576 顆,系統共享總容量達 110TB,單顆容量少了約三分之一,系統總容量卻是前者的五倍上下。其三,降層數本質上是在產能有限下壓降工藝難度和成本,以數量取勝。

但這帶來兩個新問題:瓶頸從記憶體廠自身擴產速度,轉向能從 台積電(以及三星、Intel)鎖定多少共同封裝產能;同時拉高對互聯的要求。壓力因此傳到提高記憶體利用率的連線技術上,包括超量 GPU 互聯下的 HBM 儲存共享、用 CXL 交換晶片做普通 DRAM 記憶體池化,以及輝達通過 CMX 產品做的 NAND 池化平台。

封裝與頻寬是另兩個關鍵變數。HBM 的高頻寬離不開與 XPU 共同封裝在矽中介層上,這一環節目前主要依賴台積電的 CoWoS 工藝,分為 S、R、L 三個變種。CoWoS-S 的問題除了貴,更在於面積受限;CoWoS-R 成本更低、面積更大,但線路精度低,不適用於 HBM 場景;CoWoS-L 以 RDL 為主體,只在需要高精度的位置嵌入小塊矽橋,單片中介層面積已能做到單次曝光的 5.5 倍,輝達從 B200 系列起已採用。Intel 的 EMIB 工藝更簡單,去掉中介層只有基板層,目前基本僅用於 Intel 內部產品。從投行統計預測看,CoWoS-L 已是主流方案,使用佔比在 60% 以上,且 CoWoS 產能增長快於 DRAM 晶圓,2027 年相比 2026 年翻倍。

頻寬方面,單個記憶體頻寬等於位寬乘以速率。從歷代 HBM 看,HBM1 到 HBM3E 位寬一直是 1024 位,頻寬提升幾乎全靠速率,但速率提升也在放緩,從每代翻倍降到每代提升 1/4 至 1/2;到了位寬翻倍的 HBM4,一開始標準速率原地踏步,後續才有所提升,可見兩者不易同時提升。目前瓶頸更多在外部頻寬,難點在基底層和中介層的設計與製造。

整體來看,HBM 是否會被取代、是否該繼續堆高,並沒有單一答案。短期內 DRAM 晶圓產能與 CoWoS 封裝產能是硬約束,降層數、多顆數有其合理性;長期看,HBM 與 HBF、DRAM 池化、NAND 池化各司其職的混合架構,可能是兼顧速度、容量與成本的現實路徑。這一演變將直接影響記憶體廠商的議價能力,以及封測、互聯等環節的價值分配。