NetApp在本周的年度大会INSIGHT 2026上发布了一类新的存储架构Novus,宣称可存储泽字节(zettabyte)级数据,并通过NFS与并行NFS提供100TB/s的聚合带宽,足以让数十万块GPU同时保持运转。大会在拉斯维加斯举行。
NetApp首席平台与技术官Arindam Banerjee在博客中解释了这套架构要解决的问题。他给出的算术是:单块GPU为保持忙碌可能需要高达2GB/s的吞吐,若要在5万块GPU上维持这一水平,就需要100TB/s的累计带宽;而传统存储阵列通常只能提供40至80GB/s,靠传统阵列达到100TB/s意味着要部署一百多套系统,每套都带自己的命名空间、故障域和管理开销。对AI工厂运营方而言,这意味着要花越来越多的时间和资金去维护存储集群。在超算领域,存储通常占整个系统成本的约20%。
Novus的关键突破在于把存储的元数据层与数据层解耦。传统做法是把所有元数据流量都送进固定数量的控制器,而Novus让每个GPU客户端直接读写底层存储,从而绕开容易堵塞大型存储系统的流量。Banerjee称,元数据与数据解耦后,两者可以按各自节奏扩展。他描述道,每一次打开、查找和布局请求都落在那些同时要提供数据服务的控制器上;一次工作区导入是数百万次小文件操作,一次检查点则是每个节点同时发起的太字节级顺序写入,紧跟在元数据流量高峰之后。集群规模扩大,元数据操作也随之扩大,直到文件系统变慢甚至停滞。
Novus的首个实现将落在NetApp的高性能存储AFF A90上,使用pNFS/NFS 4.2、Linux客户端以及其ONTAP存储操作系统。NetApp还开发了一个名为Novus Data Director的软件,把元数据流量转移到可独立扩展、软件定义的控制层上,运行在标准x86计算上。按Banerjee的描述,客户端先向Data Director询问文件位置,拿到布局后直接与存储通信,两个平面互不等待,数据以线速运行。
单一超大命名空间带来的好处是可扩展性。Banerjee称,一个泽字节级命名空间省去了让数据集、检查点和模型产物持续可寻址的麻烦,运营方可以在不强制应用改动、不中断重挂载、不打断租户的情况下增加容量与性能。
Novus瞄准的是AI工厂——那些正在建设、将容纳数十万到数百万块AI加速器、消耗数百兆瓦到吉瓦级电力的超大型数据中心。NetApp认为,这类设施若沿用传统存储架构,迟早会撞上存储瓶颈。洛斯阿拉莫斯国家实验室计算技术高级主管Gary Grider在博客中表示,把业界带到AI时代起点的那些架构,无法满足持续加速创新所提出的需求;随着AI工厂扩展,数十万块GPU会同时打向单一命名空间,造成大量元数据操作积压,拖慢甚至卡死文件系统,而Novus让元数据层与数据层各自独立扩展。
除Novus外,NetApp在本次大会上还发布了多项内容:NetApp Platform新增混合多云能力,提供对混合存储集群的更好控制、自主运维、新的AI ChatOps界面、感知主权的存储服务,以及与Nutanix虚拟化环境的集成;NetApp AI Data Engine(AIDE)新增零拷贝数据激活,让客户在满足治理、韧性与开放性要求的同时访问原地数据;此外还扩大了与SAP、Oracle和Supermicro的合作并推出新能力。