海豚研究在一篇分析中指出,AI内存技术路线近期出现两个方向相反的信号:一方面HBM堆叠层数继续加码,从12层走向16层乃至20层;另一方面据SemiAnalysis,英伟达下一代Rubin Ultra的HBM配置可能从16层一路砍到8层,同时以NAND闪存颗粒为基础的HBF(高带宽闪存)也在试图从HBM手中分走一部分容量需求。

文章围绕容量、带宽、成本三条线索展开。扩大内存容量目前有两条并行路径:一是把单颗内存做得更强,代价是更复杂的工艺、更高成本和可能更低的良率;二是以数量取胜,用不同规格的产品匹配不同层级的需求。

在单颗性能路径上,最直接的做法是继续增加堆叠层数。但HBM与XPU共同封装、共用底座和顶盖,内存堆总高度受限:HBM3E及之前规范上限为720um,HBM4放宽到775um。限高之下要塞进更多层,只能削薄单层DRAM颗粒、压缩层间空隙,甚至去掉微凸点改用铜铜键合。更精密的工艺意味着更高成本和更低良率,削薄后的硅片更易翘曲,层间散热和绝缘填充也更难。另一条捷径是把GPU下方的中介层垫高,让内存堆可用高度提升到约800um,但按每层宽度估算最多只能再多放2层。

以量取胜的路径则是增加内存数量。由于紧贴XPU的位置有限,新增内存大概率只能放在后排,代价是带宽更低。后排可以用HBM,也可以用普通DDR乃至基于NAND的HBF。但后排不能无限加,带宽是最大瓶颈:后排内存的数据需前排内存中转,整个多排内存的最大带宽受限于首排HBM与XPU之间的带宽。

HBF的结构基本是HBM的复刻,多层堆叠、TSV贯通、与XPU共同封装,只是把DRAM颗粒换成NAND颗粒。文章提到,计划于2026年末至2027年初推出的HBF Gen1(16层堆叠),单堆容量可达512GB,而16层HBM4只有48GB;HBF单GB价格据调研可能只有HBM的1/5至1/10左右。据公司披露,HBF Gen1读取带宽可达1.6TB/s,约为HBM4规范最高带宽的55%。但NAND天生延迟高、写入慢、按块读取、擦写寿命有限,注定无法取代HBM,只适合不需要频繁读写的数据,如全量模型参数、压缩后的上下文缓存、暂未调用的MoE专家参数等。

文章认为,最可能的远期解是多级、混合的存储架构:XPU一侧共同封装HBM提供高传输速度,另一侧封装HBF提供更大容量。更远期的HBM7设想中,还会再加一层走PCIe协议的池化存储,让每颗XPU都能共享调用整个系统的DRAM、SSD和HBF。

针对HBM层数可能不增反减的市场热议,文章列出三个原因。其一是DRAM晶圆产能有限:目前要产出同等GB容量,HBM消耗的DRAM晶圆本已是常规DRAM的3至4倍,堆叠层数继续加高对晶圆损耗更大,同样产线下能产出的存储总容量反而变少。其二是互联规模扩大,系统总容量不降反升:B300单颗GPU配8颗12层HBM3E、共288GB,一个机柜最多互联72颗,总容量约20TB;而Rubin Ultra单颗GPU即便只配8颗8层HBM、共192GB,最多可互联576颗,系统共享总容量达110TB。其三是降层数可压降工艺难度和成本。

但降层数也带来新问题:瓶颈从内存厂自身扩产速度,转向能从台积电(以及三星、Intel)锁定多少共同封装产能;同时对互联技术提出更高要求,包括超量GPU互联下的HBM存储共享、用CXL交换芯片做DRAM内存池化,以及英伟达通过CMX产品做NAND池化平台。

文章还讨论了封装与带宽两个关键要素。HBM的高带宽离不开与XPU共同封装在硅中介层上,这一环节目前主要依赖台积电的CoWoS工艺。CoWoS有S、R、L三个变种,其中CoWoS-L以RDL为主体,只在HBM与XPU连接处嵌入小块硅桥,单片中介层面积已能做到单次曝光的5.5倍,英伟达从B200系列起已采用。据投行统计预测,CoWoS-L使用占比已在60%以上,且CoWoS产能增长快于DRAM晶圆产能。

在带宽方面,单个内存带宽等于位宽乘以速率。文章指出,位宽和速率看似携手,实则相互制约。从历代HBM看,HBM1到HBM3E位宽一直是1024位,带宽提升几乎全靠速率,但速率提升也在放缓;而到位宽翻倍的HBM4,一开始标准速率原地踏步,后续才有所提升。目前瓶颈更多在外部带宽,难点在基底层和中介层的设计与制造。

整体来看,这篇文章属于海豚研究对AI内存技术路线的分析评论,核心判断是:HBM层数是否继续堆高,取决于DRAM晶圆产能、共同封装产能与带宽提升速度三者的博弈;而HBF等NAND方案更可能以补充角色进入混合存储架构,而非直接取代HBM。