MLCommons于9月1日发布MLPerf Storage v3.0基准测试榜单,焱融全闪AI存储F9000X在多项测试中拿下第一。这家国产存储厂商同时公布了面向推理场景的YRCache ContextBox一体机,并宣称其单位性能硬件成本较行业市场平均水平降低约35%、Token效能提升120%。

随着AI产业从模型训练走向规模化推理,存储系统承担的任务正在发生变化。训练阶段,存储需要持续向GPU供给海量数据,并快速保存和恢复模型Checkpoint;推理阶段,系统则要管理不断膨胀的KV Cache。单一的高性能存储产品已难以覆盖AI全流程需求,这为能够横跨训练与推理的存储方案留出了空间。

训练侧:三节点带宽刷新纪录

大模型训练需要持续从存储系统读取数据。随着参与训练的GPU数量增加,存储系统要同时为更多计算节点供给数据,吞吐不足会直接导致GPU等待、利用率下降。训练过程中定期写入Checkpoint的读写性能,也会影响模型状态保存和训练中断后的恢复耗时。

F9000X是焱融面向大规模AI训练推出的全闪存储产品。本次测试环境包括3台F9000X存储节点和9台x86客户端服务器,节点间通过NDR400高速网络互联。在3D U-Net模型训练测试中,F9000X三节点集群实现544GiB/s聚合带宽,位列该场景第一,达到历届公开测试成绩中的最高水平;相比此前v2.0测试的478GiB/s进一步提升。在Checkpoint 70B测试中,该集群实现539GiB/s读带宽314GiB/s写带宽,读写性能均位居第一。对于千亿级、万亿级模型训练,更快的Checkpoint读写可以缩短存档与恢复耗时,降低训练中断造成的算力浪费。对企业而言,更高的带宽表现也有望在满足同等训练需求的情况下减少存储节点投入。

推理侧:补上共享缓存层

进入推理阶段后,存储系统关注的重点转向模型上下文的管理与复用。长文本、多轮对话和Agent应用会产生大量KV Cache,如果这些缓存无法被保存和复用,模型就需要反复计算相同的上下文。推理请求的上下文更长、并发更高,KV Cache还需要在不同节点之间共享、迁移和复用。

焱融为此推出AI原生推理存储系统YRCache,对不同层级的KV Cache资源进行统一管理,并将部分缓存从GPU显存卸载至主机内存和本地SSD。其多级缓存架构中,G1为GPU HBM,保存当前最活跃的KV Cache;G2为主机DRAM,承接暂时无法放入GPU显存的缓存;G3为本地SSD,容量更大、单位成本更低;G4为传统共享分布式存储,承载模型、数据集和Checkpoint等长期数据。

随着推理集群扩大,本地SSD与传统共享存储之间出现了能力空档。参考英伟达CMX架构对G3.5 Context Memory的设计,焱融在YRCache体系中引入G3.5共享缓存层,并推出YRCache ContextBox一体机,面向长上下文、多轮对话和Agent推理提供跨节点共享的KV Cache空间。焱融科技称,ContextBox单台实测带宽达120GB/s,可支持8个推理节点并发接入,缓存容量可扩展至PB级

该产品的核心价值在于让不同推理节点共享已生成的KV Cache:请求即使被调度到另一台服务器,也不必重新计算相同上下文;缓存不再受单台服务器的显存、内存和SSD容量限制,企业可单独扩展缓存空间,计算节点增减时已保存的缓存也不会丢失。据焱融科技介绍,在某头部AI企业测试中,8张NVIDIA H20-3e GPU运行SGLang和GLM-5.1,输入上下文为31K至129K时,接入ContextBox后首Token时延降低89%至94%,Token吞吐提升3至6倍。ContextBox还兼容YRCache、LMCache、Mooncake等管理软件。

全流程竞争与成本账

焱融已形成覆盖AI训练与推理的存储方案,以F9000X、YRCache推理存储系统和YRCache ContextBox一体机为代表,覆盖训练数据读取、模型状态保存以及KV Cache管理等环节。训练时,F9000X提升数据和Checkpoint读写效率,减少GPU等待;推理时,YRCache和ContextBox管理、共享并复用KV Cache,减少重复计算。

对企业而言,这套方案的价值不只是提升带宽或降低时延,更在于让现有算力基础设施承载更多训练任务和推理请求。存储效率提高后,企业不必只依靠增加GPU或存储节点来扩大AI服务能力。性能之外,成本也是AI基础设施建设的重要考量,焱融科技称其单位性能硬件成本较行业市场平均水平降低约35%,同时Token效能提升120%。

当AI竞争进入规模化应用阶段,存储不再只是后台的数据底座,而成为影响GPU利用率、推理效率和建设成本的关键基础设施。随着模型规模、上下文长度和并发请求继续增加,AI存储的竞争也将从单一的峰值性能,转向对不同数据、不同层级和不同使用周期的协同管理。