推理過程中產生的KV Cache已經大到需要單獨管理,這正在成為行業共識。在2026年的華為全聯接大會上,華為推出了OceanStor M900;輝達此前也已推出CMX Context Memory Storage。這類產品把推理中已經產生、可能被再次複用的KV Cache做分層管理和儲存,後續請求命中時直接複用,從而減少重複計算、節省算力開銷。有從業者表示,即便命中率已經很高,從90%提升到95%依然很有價值。
但問題隨之而來:在儲存價格高企的當下,單獨儲存這些可能複用的快取,到底是一筆怎樣的賬?長期研究儲存的學者章衡對雷峰網表示,KV Cache外接的核心邏輯是「以存換算」,本質是在計算成本和儲存成本之間找平衡點。他舉例說,命中率從90%提高到95%,需要重新計算的部分就從10%降到5%,相當於那部分算力開銷減少了一半。但命中率繼續往上走,也意味著要儲存更多歷史KV,尤其在高命中率區間,為覆蓋最後幾個百分點的長尾資料,所需儲存容量可能明顯增加。
第一筆賬是這些KV Cache值不值得存。某頭部儲存廠商負責人李輝認為,不同應用的資料生命週期差異很大:部分消費端應用的KV Cache可能幾分鐘或一兩小時後就被清理,而一些企業端應用更看重上下文的持續性,歷史KV跨請求保留更久、供後續複用的價值也更高。
第二筆賬是存在哪裡。李輝表示,如果DRAM足夠便宜且供應充足,全部放在DRAM裡最省事、效能也最好,但現實是DRAM既貴又缺,這給SSD留出了空間。這種替換並非把1TB DRAM簡單換成1TB SSD:從整體成本看,DRAM與SSD之間不是1:1,而是「1:N」,一些方案中甚至可能達到一比五、一比十;按相同容量計算,兩者成本可以相差數十倍。正是這種價差,讓記憶體解除安裝從過去資源不足時的兜底手段,逐漸進入新系統的初始設計。不過企業用更便宜的SSD替代部分DRAM容量時,需要增加的SSD規模也更大,最終仍要同時權衡容量、效能和採購成本。
章衡補充說,現階段多數推理場景還沒到必須增加獨立KV儲存裝置才能執行的程度,企業通常會先把伺服器內已有的DRAM、記憶體池和本地SSD用滿,再逐步考慮外部儲存。華為M900和輝達CMX的出現,說明原本更多發生在伺服器內部的KV分層,已開始走向獨立的共享儲存層。
獨立KV儲存裝置已經出現,但真正承接這些快取的SSD還沒有形成成熟統一的產品品類。李輝告訴雷峰網,行業已開始討論面向AI推理、尤其是KV Cache負載最佳化的SSD,但落到採購端,大多數客戶買的仍是普通企業級SSD,市場上更多還是三星、閃迪、美光等廠商的傳統企業級產品。原因不是SSD做不出來,而是KV Cache究竟會帶來什麼樣的負載,行業還沒完全摸清。
李輝舉例說,他接觸到的一類方案,最初對SSD耐寫能力的要求約為3 DWPD,後來又提高到9 DWPD(DWPD即每天整盤寫入次數),而指標可能明天變12、後天又變5。指標反覆變化,首先取決於KV Cache要儲存多久:若只儲存幾分鐘,資料頻繁更新,SSD每天承受的寫入壓力更高,對耐久度要求隨之上升;若資料要儲存幾個星期,寫入頻率下降,耐寫能力反而不是主要矛盾,容量需求更突出。由於不同業務的資料生命週期可能從分鐘、小時延伸到天甚至周,在應用形態尚未穩定時,SSD需要多大容量、多高耐久度和怎樣的效能指標,都很難提前確定。
對儲存廠商而言,SSD是高度依賴規模的產品。李輝坦言,如果沒有標準化,這個市場就很難形成規模;如果不同客戶各自定義一套規格,產品容易停留在定製化階段。他估算,行業形成較統一的產品共識可能還需要6至12個月,即便標準確定,後續產品開發、驗證和最佳化還可能再花約1年。他還提到,北美市場已有客戶因AI推理和KV Cache增加SSD採購,中國市場也開始出現加單但速度相對更慢,目前國內SSD需求的大頭仍在訓練和常規推理,KV Cache相關需求還在方案階段。
那麼,把歷史KV搬走,HBM和DRAM的負載有沒有緩解?目前最直接緩解的是DRAM壓力。章衡表示,外接KV快取的目標之一是減少伺服器對大容量DRAM的依賴,核心是「換記憶體」而非「換視訊記憶體」——記憶體太貴,不如少買記憶體、多買SSD。相比之下,對HBM的緩解沒那麼直接:外部儲存更多影響首Token延遲,歷史KV從外部調回的速度決定模型多久開始生成首個Token,而一旦開始生成,相關KV已回到視訊記憶體,後續速度仍依賴高速視訊記憶體。
把歷史KV放到更大容量的儲存裡,只解決了容量和成本問題。AI晶片公司創始人顧淮指出,當前推理中模型權重和資料仍需不斷搬運,SSD解決的是存得下、存得有價效比,但解決不了搬得夠不夠快。存算一體(CIM)試圖減少的正是這種搬運開銷,把部分計算放到資料附近完成。顧淮認為,這種優勢在Prefill階段尤其明顯,高併發下同一組模型引數可服務多個請求,他以100路併發為例說明引數可被複用、無需為每個請求重複搬運;到了Decode階段,不同請求的KV快取並不完全相同,可重複利用的資料更少,收益不如Prefill明顯。但他也強調,存算一體並不能替代歷史KV Cache的儲存需求,歷史對話產生的大量KV仍需儲存在SSD等大容量介質中,命中時再調回計算路徑。
回到最初的問題:儲存那些可能被複用的推理快取,是一筆怎樣的賬單?它並不是簡單多花一筆儲存成本就能等額省下算力成本。KV Cache儲存多久、能被複用多少次、用什麼介質,以及調取過程中還要付出多少資料搬運成本,都在影響最終選擇。大模型記住過去,基礎設施也開始為「記憶」買單。