推理过程中产生的KV Cache已经大到需要单独管理,这正在成为行业共识。在2026年的华为全联接大会上,华为推出了OceanStor M900;英伟达此前也已推出CMX Context Memory Storage。这类产品把推理中已经产生、可能被再次复用的KV Cache做分层管理和存储,后续请求命中时直接复用,从而减少重复计算、节省算力开销。有从业者表示,即便命中率已经很高,从90%提升到95%依然很有价值。

但问题随之而来:在存储价格高企的当下,单独保存这些可能复用的缓存,到底是一笔怎样的账?长期研究存储的学者章衡对雷峰网表示,KV Cache外置的核心逻辑是「以存换算」,本质是在计算成本和存储成本之间找平衡点。他举例说,命中率从90%提高到95%,需要重新计算的部分就从10%降到5%,相当于那部分算力开销减少了一半。但命中率继续往上走,也意味着要保存更多历史KV,尤其在高命中率区间,为覆盖最后几个百分点的长尾数据,所需存储容量可能明显增加。

第一笔账是这些KV Cache值不值得存。某头部存储厂商负责人李辉认为,不同应用的数据生命周期差异很大:部分消费端应用的KV Cache可能几分钟或一两小时后就被清理,而一些企业端应用更看重上下文的持续性,历史KV跨请求保留更久、供后续复用的价值也更高。

第二笔账是存在哪里。李辉表示,如果DRAM足够便宜且供应充足,全部放在DRAM里最省事、性能也最好,但现实是DRAM既贵又缺,这给SSD留出了空间。这种替换并非把1TB DRAM简单换成1TB SSD:从整体成本看,DRAM与SSD之间不是1:1,而是「1:N」,一些方案中甚至可能达到一比五、一比十;按相同容量计算,两者成本可以相差数十倍。正是这种价差,让内存卸载从过去资源不足时的兜底手段,逐渐进入新系统的初始设计。不过企业用更便宜的SSD替代部分DRAM容量时,需要增加的SSD规模也更大,最终仍要同时权衡容量、性能和采购成本。

章衡补充说,现阶段多数推理场景还没到必须增加独立KV存储设备才能运行的程度,企业通常会先把服务器内已有的DRAM、内存池和本地SSD用满,再逐步考虑外部存储。华为M900和英伟达CMX的出现,说明原本更多发生在服务器内部的KV分层,已开始走向独立的共享存储层。

独立KV存储设备已经出现,但真正承接这些缓存的SSD还没有形成成熟统一的产品品类。李辉告诉雷峰网,行业已开始讨论面向AI推理、尤其是KV Cache负载优化的SSD,但落到采购端,大多数客户买的仍是普通企业级SSD,市场上更多还是三星、闪迪、美光等厂商的传统企业级产品。原因不是SSD做不出来,而是KV Cache究竟会带来什么样的负载,行业还没完全摸清。

李辉举例说,他接触到的一类方案,最初对SSD耐写能力的要求约为3 DWPD,后来又提高到9 DWPD(DWPD即每天整盘写入次数),而指标可能明天变12、后天又变5。指标反复变化,首先取决于KV Cache要保存多久:若只保存几分钟,数据频繁更新,SSD每天承受的写入压力更高,对耐久度要求随之上升;若数据要保存几个星期,写入频率下降,耐写能力反而不是主要矛盾,容量需求更突出。由于不同业务的数据生命周期可能从分钟、小时延伸到天甚至周,在应用形态尚未稳定时,SSD需要多大容量、多高耐久度和怎样的性能指标,都很难提前确定。

对存储厂商而言,SSD是高度依赖规模的产品。李辉坦言,如果没有标准化,这个市场就很难形成规模;如果不同客户各自定义一套规格,产品容易停留在定制化阶段。他估算,行业形成较统一的产品共识可能还需要6至12个月,即便标准确定,后续产品开发、验证和优化还可能再花约1年。他还提到,北美市场已有客户因AI推理和KV Cache增加SSD采购,中国市场也开始出现加单但速度相对更慢,目前国内SSD需求的大头仍在训练和常规推理,KV Cache相关需求还在方案阶段。

那么,把历史KV搬走,HBM和DRAM的负载有没有缓解?目前最直接缓解的是DRAM压力。章衡表示,外置KV缓存的目标之一是减少服务器对大容量DRAM的依赖,核心是「换内存」而非「换显存」——内存太贵,不如少买内存、多买SSD。相比之下,对HBM的缓解没那么直接:外部存储更多影响首Token延迟,历史KV从外部调回的速度决定模型多久开始生成首个Token,而一旦开始生成,相关KV已回到显存,后续速度仍依赖高速显存。

把历史KV放到更大容量的存储里,只解决了容量和成本问题。AI芯片公司创始人顾淮指出,当前推理中模型权重和数据仍需不断搬运,SSD解决的是存得下、存得有性价比,但解决不了搬得够不够快。存算一体(CIM)试图减少的正是这种搬运开销,把部分计算放到数据附近完成。顾淮认为,这种优势在Prefill阶段尤其明显,高并发下同一组模型参数可服务多个请求,他以100路并发为例说明参数可被复用、无需为每个请求重复搬运;到了Decode阶段,不同请求的KV缓存并不完全相同,可重复利用的数据更少,收益不如Prefill明显。但他也强调,存算一体并不能替代历史KV Cache的存储需求,历史对话产生的大量KV仍需保存在SSD等大容量介质中,命中时再调回计算路径。

回到最初的问题:存储那些可能被复用的推理缓存,是一笔怎样的账单?它并不是简单多花一笔存储成本就能等额省下算力成本。KV Cache保存多久、能被复用多少次、用什么介质,以及调取过程中还要付出多少数据搬运成本,都在影响最终选择。大模型记住过去,基础设施也开始为「记忆」买单。