NetApp在本週的年度大會INSIGHT 2026上釋出了一類新的儲存架構Novus,宣稱可儲存澤位元組(zettabyte)級資料,並通過NFS與並行NFS提供100TB/s的聚合頻寬,足以讓數十萬塊GPU同時保持運轉。大會在拉斯維加斯舉行。

NetApp首席平台與技術官Arindam Banerjee在部落格中解釋了這套架構要解決的問題。他給出的算術是:單塊GPU為保持忙碌可能需要高達2GB/s的吞吐,若要在5萬塊GPU上維持這一水平,就需要100TB/s的累計頻寬;而傳統儲存陣列通常只能提供40至80GB/s,靠傳統陣列達到100TB/s意味著要部署一百多套系統,每套都帶自己的名稱空間、故障域和管理開銷。對AI工廠運營方而言,這意味著要花越來越多的時間和資金去維護儲存叢集。在超算領域,儲存通常佔整個系統成本的約20%。

Novus的關鍵突破在於把儲存的後設資料層與資料層解耦。傳統做法是把所有後設資料流量都送進固定數量的控制器,而Novus讓每個GPU客戶端直接讀寫底層儲存,從而繞開容易堵塞大型儲存系統的流量。Banerjee稱,後設資料與資料解耦後,兩者可以按各自節奏擴充套件。他描述道,每一次開啟、查詢和佈局請求都落在那些同時要提供資料服務的控制器上;一次工作區匯入是數百萬次小檔案操作,一次檢查點則是每個節點同時發起的太位元組級順序寫入,緊跟在後設資料流量高峰之後。叢集規模擴大,後設資料操作也隨之擴大,直到檔案系統變慢甚至停滯。

Novus的首個實現將落在NetApp的高效能儲存AFF A90上,使用pNFS/NFS 4.2、Linux客戶端以及其ONTAP儲存作業系統。NetApp還開發了一個名為Novus Data Director的軟體,把後設資料流量轉移到可獨立擴充套件、軟體定義的控制層上,執行在標準x86計算上。按Banerjee的描述,客戶端先向Data Director詢問檔案位置,拿到佈局後直接與儲存通訊,兩個平面互不等待,資料以線速執行。

單一超大名稱空間帶來的好處是可擴充套件性。Banerjee稱,一個澤位元組級名稱空間省去了讓資料集、檢查點和模型產物持續可定址的麻煩,運營方可以在不強制應用改動、不中斷重掛載、不打斷租戶的情況下增加容量與效能。

Novus瞄準的是AI工廠——那些正在建設、將容納數十萬到數百萬塊AI加速器、消耗數百兆瓦到吉瓦級電力的超大型資料中心。NetApp認為,這類設施若沿用傳統儲存架構,遲早會撞上儲存瓶頸。洛斯阿拉摩斯國家實驗室計算技術高階主管Gary Grider在部落格中表示,把業界帶到AI時代起點的那些架構,無法滿足持續加速創新所提出的需求;隨著AI工廠擴充套件,數十萬塊GPU會同時打向單一名稱空間,造成大量後設資料操作積壓,拖慢甚至卡死檔案系統,而Novus讓後設資料層與資料層各自獨立擴充套件。

除Novus外,NetApp在本次大會上還發布了多項內容:NetApp Platform新增混合多雲能力,提供對混合儲存叢集的更好控制、自主運維、新的AI ChatOps介面、感知主權的儲存服務,以及與Nutanix虛擬化環境的整合;NetApp AI Data Engine(AIDE)新增零複製資料啟用,讓客戶在滿足治理、韌性與開放性要求的同時訪問原地資料;此外還擴大了與SAP、Oracle和Supermicro的合作並推出新能力。