在 Hot Chips 2026 大会上,GPU IP 公司 OXMIQ 展示了其高带宽闪存(HBF)的用例研究,结论是 HBF 无法在绝大多数工作负载中替代高带宽内存HBM),但在某些特定场景下,HBF 可作为大容量、相对冷数据的专用内存层级,而在另一些场景中,HBF 可能弊大于利。

HBF 概念最初由 SanDisk 于 2025 年初提出,旨在为 AI 加速器提供数 TB 级、成本相对较低的内存,以减少对传统 HBM 的依赖。该技术基于 3D NAND,支持 64 字节至 4KB 的读取块大小、4KB 写入和 4KB 页大小。新兴的 HBF 规范包含三个性能等级:Grade 1 采用 8-Hi 256GB NAND 堆叠,搭配 8 GT/s UCIe 接口,带宽为 384 GB/s;Grade 2 采用 512GB NAND 堆叠,搭配 16 GT/s UCIe 接口,带宽达 1.536 TB/s;Grade 3 则通过 32 GT/s UCIe 2.0 实现 3.072 TB/s 带宽,容量仍为 512GB。OXMIQ 指出,HBF Grade 1 几乎无法与当代 HBM 竞争,而 Grade 3 可与 HBM4E 抗衡,但尚不清楚此类内存何时可用。HBF 的核心优势并非性能,而是在相近成本下提供比 HBM 多 8 至 16 倍的容量。

OXMIQ 认为,HBF 应被视为高容量内存技术,而非廉价的 HBM。内存经济性不仅取决于应用需要存储的 GB 数,还取决于数据传送到处理器的速度。随着带宽需求上升,增加相对廉价但较慢的 HBF 最终可能不如使用 HBM 经济。OXMIQ 通过建模展示了这一权衡:在一个 72-GPU 机架中运行 1 万亿参数的 Kimi-K2 模型(FP4 精度),在成本和功耗相同的情况下,纯 HBM 配置提供 20.7 TB 内存和 1,584 TB/s 聚合带宽;纯 HBF 配置将机架容量提升 14 倍至 294.9 TB,但聚合带宽降至 922 TB/s;混合配置则提供 89.3 TB 内存和 279 TB/s 至 1,418 TB/s 的带宽(取决于工作负载)。

在 OXMIQ 的模型中,纯 HBF 配置使每个 GPU 都能独立承载一个 Kimi-K2 实例,每机架可运行 72 个模型实例;而纯 HBM 配置则需要 8 个 GPU 才能承载一个实例(导致算力浪费),每机架仅能运行 9 个实例。因此,当内存容量成为 GPU 数量的决定因素时,HBF 极具吸引力。然而,随着并发用户数和 token 生成速率增加,HBF 的较低带宽成为瓶颈,而基于 HBM 的机架能更充分利用其高带宽,最终实现更低的每 token 成本。OXMIQ 总结道:“HBM 用于机架,HBF 用于单机。”

尽管 HBF 并非对所有 AI 工作负载都有益,甚至可能损害许多工作负载的性能,但某些应用可从大量本地内存中获益。混合专家(MoE)模型似乎特别适合 HBF。OXMIQ 的 Kimi-K3 示例中,1.56 TB 权重中有 1.45 TB(93%)为 MoE 专家权重,这些权重通常只写入一次且读取频率相对较低。OXMIQ 建议将这些专家权重置于 HBF,而将频繁访问的权重保留在 HBM 中。此外,更大的本地容量可减少加速器间的通信。传统专家并行将专家分布在不同 GPU 上,每层都需要全对全通信;OXMIQ 称,廉价的 HBF 容量可让更多专家驻留本地,减少专家并行分片,降低网络流量,从而用内存容量换取互连带宽和功耗。

长上下文推理是另一个潜在用例。稀疏注意力模型在每次解码步骤中仅访问大型 KV 缓存的一小部分,其余部分可留在较慢的 HBF 中。OXMIQ 认为,HBF 可存储大型 KV 缓存,加速器仅从 HBF 获取每步所需数据。然而,HBM 缓存策略存在严重局限:将热门专家置于 HBM、冷专家置于 HBF 的策略仅在低批处理大小或相似查询可被刻意分批时有效。随着批处理大小增加和查询异构性增强,专家流行度趋于平坦,工作集可能超出 HBM 缓存容量,导致专家从 HBF 迁移更频繁,降低 HBM 缓存的性能收益。

OXMIQ 并不期望 HBF 仅作为较慢的 GPU 内存工作,而是提议将 HBF 用作主机 DRAM 的替代品,以存储大量不常访问的数据。总体而言,HBF 在容量受限场景下优势明显,但在带宽受限时则可能拖累性能,其适用性需根据具体工作负载评估。