在HBM熱潮之外,儲存行業的其他環節也正被推上風口。第五屆GMIF2026全球儲存器行業創新峰會上,摩根士丹利執行董事、大中華區半導體分析師顏志天給出一個關鍵判斷:以全球雲資料中心資本支出為口徑,在未計入HBM的情況下,2026年儲存佔比接近五成,2027年預計進一步升至53%。這意味著儲存正在從資料中心的配套部件,變成資本開支中權重最高的類別之一。

推動這一變化的底層力量是推理需求的爆發。截至今年3月,中國日均Token呼叫量已突破140萬億。三星電子副總裁、Memory事業部技術長Kevin Yoon在現場做了一個直觀換算:中國每天消耗的Token,相當於中國國家圖書館全部藏書對應Token量的20倍以上,也接近人類歷史上所有出版圖書總量的6倍。這一量級的推理負載,對儲存提出的要求遠不止容量增長。

Solidigm亞太區銷售副總裁倪錦峰將規模化推理給儲存帶來的壓力歸納為三個維度。第一是資料豐富度:以星河智聯展示的車載Agent為例,系統需要同時處理語音、視覺、車輛訊號等多模態資訊,還要結合對話歷史、長期記憶、使用者畫像和即時車身狀態做判斷,資料來源、形態和更新頻率差異極大。第二是推理複雜度:Arm全球儲存業務負責人John Xavier Lionel拆解指出,模型變大帶來更多權重和執行時狀態,上下文變長推高KV Cache佔用,併發使用者增多則要求為每個請求單獨保留KV Cache,進入逐Token生成的Decode階段後,模型權重和KV Cache還會被反覆訪問。第三是運營永續性:Dify聯合創始人陳璐莎判斷,未來企業執行的Agent數量可能從個位數升至數百個,且需24小時待命、執行長程任務並承擔高併發請求。

這些壓力疊加,直接推動SSD、HDD和NAND開始突破原有分工。SSD過去主要承擔大容量持久化儲存,如今多家企業從多個維度展開升級。慧榮科技的做法是通過主機軟體和儲存軟體棧識別任務型別,再由SSD控制器按QoS等級調整資源配置,使同一塊SSD能響應不同AI負載。閃迪資深產品市場總監張丹則按與計算單元的距離把SSD分為三類:直接連線GPU的SSD承接熱KV等高頻訪問資料,通過網路連線GPU的SSD服務計算但可更大規模部署,位於計算叢集之外的儲存型SSD更強調容量。倪錦峰還觀察到,為減少機房空間佔用和功耗開銷,北美大型網際網路公司已開始用大容量QLC SSD替代部分HDD。

HDD並未因此退場。大數極限設計的PMD定位於傳統HDD與企業級SSD之間,試圖通過多路並行、擴大I/O請求佇列,並結合請求聚合、預取和快取等方式提高頻寬和隨機訪問能力。測試環節也在變化:歐康諾在AI SSD測試中加入了深度學習I/O負載以及KV Cache、斷點恢復等場景,因為AI負載的I/O行為比傳統固定塊讀寫更復雜。

更底層的變化發生在NAND。三星設計的Z-NAND核心Die基於SLC並整合TSV等技術提升讀取效能,其架構中作業系統和KV Cache留在DRAM,大容量、讀取密集的模型權重放入Z-NAND。另一條路徑是將NAND升級為HBF(高頻寬快閃記憶體)。北京大學積體電路學院院長蔡一茂介紹,目前主要有兩條技術路徑:一是從NAND陣列本身入手縮小陣列尺寸以降低讀取時延,二是借鑑HBM思路增加介面數量以提升頻寬。但他也指出,縮小陣列會犧牲部分儲存密度、NAND讀取時延仍偏高、有限的寫入壽命難以承受KV Cache等資料的頻繁更新,這些問題尚待解決。更激進的方向是利用NAND陣列直接完成部分存內計算,減少資料在儲存與計算單元之間的往返,北大正與燕芯微等合作伙伴探索這一路徑。

儲存介質能力邊界的外擴,正在鬆動傳統儲存金字塔的穩定分工。過去資料與介質的對應關係相對固定,如今同一份資料的訪問頻率和生命週期會隨計算過程不斷變化。多位與會嘉賓認為,真正的變化在於資料管理正從“HBM不夠給DRAM、DRAM不夠給SSD”的兜底式分層,轉向系統設計之初的主動分層和執行過程中的動態排程。芯展速副總裁李蓁用儲存、連線、解決方案三個關鍵詞拆解AI資料供給體系;聯芸與寅譜聯合推出的AI SSD方案則把這種分工落到推理執行中——針對MoE模型引數,當前呼叫的專家權重留在CPU記憶體和GPU視訊記憶體,暫不呼叫的放入SSD,系統還會預測下一階段可能呼叫的專家並提前預取;針對KV Cache,高頻訪問的留在記憶體,低頻部分下沉到SSD。傑創智慧的常青雲平台則把範圍放大到整個算力叢集,提前將任務所需資料準備到相應節點,並結合任務型別、GPU代際和網路頻寬匹配算力資源。

正如佰維儲存董事長孫成思在現場的判斷——資料供給的效率決定算力的產出。當AI推理走向規模化、高併發和持續執行,儲存要回答的問題已不只是資料放在哪裡,而是如何讓資料及時抵達算力。