AI 内存正站在一个岔路口:一边是 HBM 路线图继续加码,堆叠层数从 12 层走向 16 层乃至 20 层;另一边,据 SemiAnalysis,英伟达下一代 Rubin Ultra 的 HBM 可能从 16 层一路砍到 8 层,单颗 GPU 的 HBM 总容量或从 768GB 砍半再砍半至 192GB。与此同时,以 NAND 闪存颗粒为基础的 HBF 也在试图从 HBM 手中分走一部分容量需求。这些信号看似矛盾,实则指向同一个约束:容量、带宽与成本三者难以兼得。
扩大内存容量,业内大致有两条并行路径。第一条是突破工艺上限,把单颗内存做得更强,最直接的办法是继续增加堆叠层数。但 HBM 与 XPU 共同封装、共用底座和顶盖,内存堆总高度受限:HBM3E 及之前规范上限为 720um,HBM4 放宽到 775um。限高之下要加层,只能削薄单层 DRAM 颗粒、压缩层间空隙,甚至去掉微凸点改用铜铜键合。代价是硅片强度下降、散热与绝缘填充更难、TSV 需要更密更细,良率与成本压力同步上升。另一种取巧办法是把 GPU 下方的中介层垫高,在顶部齐平的前提下让内存堆可用高度提升到约 800um,但能挤出的空间有限,最多再多放两层。
第二条路径是以量取胜,增加内存数量。由于紧贴 XPU 的位置有限,新增内存大概率只能放在后排,省去加密堆叠的工艺难题,代价是后排带宽势必更低。后排用什么内存、怎么封装都有选择:规格上可用普通 DDR 乃至基于 NAND 的 HBF,封装上可放在硅中介层、基板或 PCB 上。但后排不能无限加,带宽是最大瓶颈——后排数据需前排内存中转,整个多排内存的最大带宽受限于首排 HBM 与 XPU 之间的带宽。
HBF 是降低单位存储价格的重要选项。它的结构基本是 HBM 的复刻:多层堆叠、TSV 贯通、与 XPU 共同封装,只是把 DRAM 颗粒换成 NAND 颗粒。计划于 2026 年末至 27 年初推出的 HBF Gen1(16 层堆叠),单堆容量可达 512GB,而 16 层 HBM4 只有 48GB;HBF 单 GB 价格据调研可能只有 HBM 的 1/5 至 1/10 左右,且 NAND 颗粒功耗和散热需求相对更低。据公司披露,HBF Gen1 读取带宽可达 1.6TB/s,约为 HBM4 规范最高带宽的 55%。但 NAND 天生延迟高、写入慢、按块读取、擦写寿命有限,注定无法取代 HBM,只适合不需要频繁读写的数据,如全量模型参数、压缩后的上下文缓存、暂未调用的 MoE 专家参数等。
由此,多级、混合的存储架构被视为最可能的远期解。例如在 XPU 一侧共同封装 HBM 提供高传输速度,负责高频读写数据;另一侧封装 HBF 提供更大容量,负责相对低频的数据。更远期的 HBM7 设想中,还会再加一层走 PCIe 协议的池化存储,让每颗 XPU 都能共享调用整个系统的 DRAM、SSD 和 HBF。
HBM 层数可能不增反减,背后有三个原因。其一,DRAM 晶圆产能有限:目前要产出同等 GB 容量,HBM 消耗的 DRAM 晶圆本已是常规 DRAM 的 3 至 4 倍,堆叠层数继续加高对晶圆损耗更大,而 DRAM 新增产能需要时间,据投行预测 2024 至 2026 年晶圆产能增长有限,2027 年才会有较多释放。其二,互联规模扩大使系统总容量不降反升:B300 单颗 GPU 配 8 颗 12 层 HBM3E、共 288GB,一个机柜最多互联 72 颗,总容量约 20TB;而 Rubin Ultra 单颗 GPU 即便只配 8 颗 8 层 HBM、共 192GB,最多可互联 576 颗,系统共享总容量达 110TB,单颗容量少了约三分之一,系统总容量却是前者的五倍上下。其三,降层数本质上是在产能有限下压降工艺难度和成本,以数量取胜。
但这带来两个新问题:瓶颈从内存厂自身扩产速度,转向能从 台积电(以及三星、Intel)锁定多少共同封装产能;同时拉高对互联的要求。压力因此传到提高内存利用率的连接技术上,包括超量 GPU 互联下的 HBM 存储共享、用 CXL 交换芯片做普通 DRAM 内存池化,以及英伟达通过 CMX 产品做的 NAND 池化平台。
封装与带宽是另两个关键变量。HBM 的高带宽离不开与 XPU 共同封装在硅中介层上,这一环节目前主要依赖台积电的 CoWoS 工艺,分为 S、R、L 三个变种。CoWoS-S 的问题除了贵,更在于面积受限;CoWoS-R 成本更低、面积更大,但线路精度低,不适用于 HBM 场景;CoWoS-L 以 RDL 为主体,只在需要高精度的位置嵌入小块硅桥,单片中介层面积已能做到单次曝光的 5.5 倍,英伟达从 B200 系列起已采用。Intel 的 EMIB 工艺更简单,去掉中介层只有基板层,目前基本仅用于 Intel 内部产品。从投行统计预测看,CoWoS-L 已是主流方案,使用占比在 60% 以上,且 CoWoS 产能增长快于 DRAM 晶圆,2027 年相比 2026 年翻倍。
带宽方面,单个内存带宽等于位宽乘以速率。从历代 HBM 看,HBM1 到 HBM3E 位宽一直是 1024 位,带宽提升几乎全靠速率,但速率提升也在放缓,从每代翻倍降到每代提升 1/4 至 1/2;到了位宽翻倍的 HBM4,一开始标准速率原地踏步,后续才有所提升,可见两者不易同时提升。目前瓶颈更多在外部带宽,难点在基底层和中介层的设计与制造。
整体来看,HBM 是否会被取代、是否该继续堆高,并没有单一答案。短期内 DRAM 晶圆产能与 CoWoS 封装产能是硬约束,降层数、多颗数有其合理性;长期看,HBM 与 HBF、DRAM 池化、NAND 池化各司其职的混合架构,可能是兼顾速度、容量与成本的现实路径。这一演变将直接影响内存厂商的议价能力,以及封测、互联等环节的价值分配。