MLCommons於9月1日釋出MLPerf Storage v3.0基準測試榜單,焱融全閃AI儲存F9000X在多項測試中拿下第一。這家國產儲存廠商同時公佈了面向推理場景的YRCache ContextBox一體機,並宣稱其單位效能硬體成本較行業市場平均水平降低約35%、Token效能提升120%。

隨著AI產業從模型訓練走向規模化推理,儲存系統承擔的任務正在發生變化。訓練階段,儲存需要持續向GPU供給海量資料,並快速儲存和恢復模型Checkpoint;推理階段,系統則要管理不斷膨脹的KV Cache。單一的高效能儲存產品已難以覆蓋AI全流程需求,這為能夠橫跨訓練與推理的儲存方案留出了空間。

訓練側:三節點頻寬重新整理紀錄

大模型訓練需要持續從儲存系統讀取資料。隨著參與訓練的GPU數量增加,儲存系統要同時為更多計算節點供給資料,吞吐不足會直接導致GPU等待、利用率下降。訓練過程中定期寫入Checkpoint的讀寫效能,也會影響模型狀態儲存和訓練中斷後的恢復耗時。

F9000X是焱融面向大規模AI訓練推出的全快閃記憶體儲產品。本次測試環境包括3台F9000X儲存節點和9台x86客戶端伺服器,節點間通過NDR400高速網路互聯。在3D U-Net模型訓練測試中,F9000X三節點叢集實現544GiB/s聚合頻寬,位列該場景第一,達到歷屆公開測試成績中的最高水平;相比此前v2.0測試的478GiB/s進一步提升。在Checkpoint 70B測試中,該叢集實現539GiB/s讀頻寬314GiB/s寫頻寬,讀寫效能均位居第一。對於千億級、萬億級模型訓練,更快的Checkpoint讀寫可以縮短存檔與恢復耗時,降低訓練中斷造成的算力浪費。對企業而言,更高的頻寬表現也有望在滿足同等訓練需求的情況下減少儲存節點投入。

推理側:補上共享快取層

進入推理階段後,儲存系統關注的重點轉向模型上下文的管理與複用。長文本、多輪對話和Agent應用會產生大量KV Cache,如果這些快取無法被儲存和複用,模型就需要反覆計算相同的上下文。推理請求的上下文更長、併發更高,KV Cache還需要在不同節點之間共享、遷移和複用。

焱融為此推出AI原生推理儲存系統YRCache,對不同層級的KV Cache資源進行統一管理,並將部分快取從GPU視訊記憶體解除安裝至主機記憶體和本地SSD。其多級快取架構中,G1為GPU HBM,儲存當前最活躍的KV Cache;G2為主機DRAM,承接暫時無法放入GPU視訊記憶體的快取;G3為本地SSD,容量更大、單位成本更低;G4為傳統共享分散式儲存,承載模型、資料集和Checkpoint等長期資料。

隨著推理叢集擴大,本地SSD與傳統共享儲存之間出現了能力空檔。參考輝達CMX架構對G3.5 Context Memory的設計,焱融在YRCache體系中引入G3.5共享快取層,並推出YRCache ContextBox一體機,面向長上下文、多輪對話和Agent推理提供跨節點共享的KV Cache空間。焱融科技稱,ContextBox單台實測頻寬達120GB/s,可支援8個推理節點併發接入,快取容量可擴充套件至PB級

該產品的核心價值在於讓不同推理節點共享已生成的KV Cache:請求即使被排程到另一台伺服器,也不必重新計算相同上下文;快取不再受單台伺服器的視訊記憶體、記憶體和SSD容量限制,企業可單獨擴充套件快取空間,計算節點增減時已儲存的快取也不會丟失。據焱融科技介紹,在某頭部AI企業測試中,8張NVIDIA H20-3e GPU執行SGLang和GLM-5.1,輸入上下文為31K至129K時,接入ContextBox後首Token時延降低89%至94%,Token吞吐提升3至6倍。ContextBox還相容YRCache、LMCache、Mooncake等管理軟體。

全流程競爭與成本賬

焱融已形成覆蓋AI訓練與推理的儲存方案,以F9000X、YRCache推理儲存系統和YRCache ContextBox一體機為代表,覆蓋訓練資料讀取、模型狀態儲存以及KV Cache管理等環節。訓練時,F9000X提升資料和Checkpoint讀寫效率,減少GPU等待;推理時,YRCache和ContextBox管理、共享並複用KV Cache,減少重複計算。

對企業而言,這套方案的價值不只是提升頻寬或降低時延,更在於讓現有算力基礎設施承載更多訓練任務和推理請求。儲存效率提高後,企業不必只依靠增加GPU或儲存節點來擴大AI服務能力。效能之外,成本也是AI基礎設施建設的重要考量,焱融科技稱其單位效能硬體成本較行業市場平均水平降低約35%,同時Token效能提升120%。

當AI競爭進入規模化應用階段,儲存不再只是後台的資料底座,而成為影響GPU利用率、推理效率和建設成本的關鍵基礎設施。隨著模型規模、上下文長度和併發請求繼續增加,AI儲存的競爭也將從單一的峰值效能,轉向對不同資料、不同層級和不同使用週期的協同管理。