在HBM热潮之外,存储行业的其他环节也正被推上风口。第五届GMIF2026全球存储器行业创新峰会上,摩根士丹利执行董事、大中华区半导体分析师颜志天给出一个关键判断:以全球云数据中心资本支出为口径,在未计入HBM的情况下,2026年存储占比接近五成,2027年预计进一步升至53%。这意味着存储正在从数据中心的配套部件,变成资本开支中权重最高的类别之一。

推动这一变化的底层力量是推理需求的爆发。截至今年3月,中国日均Token调用量已突破140万亿。三星电子副总裁、Memory事业部首席技术官Kevin Yoon在现场做了一个直观换算:中国每天消耗的Token,相当于中国国家图书馆全部藏书对应Token量的20倍以上,也接近人类历史上所有出版图书总量的6倍。这一量级的推理负载,对存储提出的要求远不止容量增长。

Solidigm亚太区销售副总裁倪锦峰将规模化推理给存储带来的压力归纳为三个维度。第一是数据丰富度:以星河智联展示的车载Agent为例,系统需要同时处理语音、视觉、车辆信号等多模态信息,还要结合对话历史、长期记忆、用户画像和实时车身状态做判断,数据来源、形态和更新频率差异极大。第二是推理复杂度:Arm全球存储业务负责人John Xavier Lionel拆解指出,模型变大带来更多权重和运行时状态,上下文变长推高KV Cache占用,并发用户增多则要求为每个请求单独保留KV Cache,进入逐Token生成的Decode阶段后,模型权重和KV Cache还会被反复访问。第三是运营持久性:Dify联合创始人陈璐莎判断,未来企业运行的Agent数量可能从个位数升至数百个,且需24小时待命、执行长程任务并承担高并发请求。

这些压力叠加,直接推动SSD、HDD和NAND开始突破原有分工。SSD过去主要承担大容量持久化存储,如今多家企业从多个维度展开升级。慧荣科技的做法是通过主机软件和存储软件栈识别任务类型,再由SSD控制器按QoS等级调整资源配置,使同一块SSD能响应不同AI负载。闪迪资深产品市场总监张丹则按与计算单元的距离把SSD分为三类:直接连接GPU的SSD承接热KV等高频访问数据,通过网络连接GPU的SSD服务计算但可更大规模部署,位于计算集群之外的存储型SSD更强调容量。倪锦峰还观察到,为减少机房空间占用和功耗开销,北美大型互联网公司已开始用大容量QLC SSD替代部分HDD。

HDD并未因此退场。大数极限设计的PMD定位于传统HDD与企业级SSD之间,试图通过多路并行、扩大I/O请求队列,并结合请求聚合、预取和缓存等方式提高带宽和随机访问能力。测试环节也在变化:欧康诺在AI SSD测试中加入了深度学习I/O负载以及KV Cache、断点恢复等场景,因为AI负载的I/O行为比传统固定块读写更复杂。

更底层的变化发生在NAND。三星设计的Z-NAND核心Die基于SLC并集成TSV等技术提升读取性能,其架构中操作系统和KV Cache留在DRAM,大容量、读取密集的模型权重放入Z-NAND。另一条路径是将NAND升级为HBF(高带宽闪存)。北京大学集成电路学院院长蔡一茂介绍,目前主要有两条技术路径:一是从NAND阵列本身入手缩小阵列尺寸以降低读取时延,二是借鉴HBM思路增加接口数量以提升带宽。但他也指出,缩小阵列会牺牲部分存储密度、NAND读取时延仍偏高、有限的写入寿命难以承受KV Cache等数据的频繁更新,这些问题尚待解决。更激进的方向是利用NAND阵列直接完成部分存内计算,减少数据在存储与计算单元之间的往返,北大正与燕芯微等合作伙伴探索这一路径。

存储介质能力边界的外扩,正在松动传统存储金字塔的稳定分工。过去数据与介质的对应关系相对固定,如今同一份数据的访问频率和生命周期会随计算过程不断变化。多位与会嘉宾认为,真正的变化在于数据管理正从“HBM不够给DRAM、DRAM不够给SSD”的兜底式分层,转向系统设计之初的主动分层和运行过程中的动态调度。芯展速副总裁李蓁用存储、连接、解决方案三个关键词拆解AI数据供给体系;联芸与寅谱联合推出的AI SSD方案则把这种分工落到推理运行中——针对MoE模型参数,当前调用的专家权重留在CPU内存和GPU显存,暂不调用的放入SSD,系统还会预测下一阶段可能调用的专家并提前预取;针对KV Cache,高频访问的留在内存,低频部分下沉到SSD。杰创智能的常青云平台则把范围放大到整个算力集群,提前将任务所需数据准备到相应节点,并结合任务类型、GPU代际和网络带宽匹配算力资源。

正如佰维存储董事长孙成思在现场的判断——数据供给的效率决定算力的产出。当AI推理走向规模化、高并发和持续运行,存储要回答的问题已不只是数据放在哪里,而是如何让数据及时抵达算力。