英伟达NVLink Fusion扩大生态影响力之际,一批网络厂商正试图提供替代性的互联与交换方案。在近日举行的AI Infra Summit上,Cornelis NetworksDelos Data正式加入AI扩展网络(scale-up networking)的竞争。所谓扩展网络,是指让多颗GPU像一颗巨型加速器一样协同工作,英伟达正是凭借NVLink把8颗、72颗乃至576颗GPU联结为单一计算域。为追赶这一能力,AMD等厂商已转向Ultra Accelerator Link(UALink)等新兴协议,但目前这些协议大多仍通过标准以太网交换机进行隧道传输。例如,AMD使用基于博通102.4 Tbps Tomahawk 6的交换机,连接MI455X上的定制I/O die。专用UALink交换机与物理互联仍难觅踪影,但Cornelis与Delos希望改变这一局面,它们从标准化、软件优化与物理硬件几个方向切入。

Cornelis Networks由英特尔于2020年分拆而来,其Omni-Path技术最初面向高性能计算(HPC)的扩展网络,曾用于Trinity、Lynx等超级计算机。该公司在AI Infra上发布了Active Compute Fabric(ACF),目标是建立一个开放架构,将可编程计算能力集成到网络结构中,同时覆盖扩展与横向扩展场景。随着其支持800 GbpsCN6000系列交换机与网卡即将推出,Cornelis不仅想通过开放的Ultra Ethernet协议触达更广泛客户,也正式进军扩展网络。ACF扩展了UALink与Ethernet for Scale-Up Networking等协议的目标,为多种硬件设定网络内计算能力的基线,而不仅限于Cornelis自家的CN系列部件。

英伟达NVSwitch ASIC的关键能力之一是支持SHARP,可将网络内集合通信卸载到交换机ASIC,从而释放GPU算力、降低通信开销。集合通信加速并非新事物,博通、思科等主要网络厂商都有不同程度的实现。作为开放架构,ACF看起来是在设定一个“最低共同标准”,让部署系统的客户清楚自己得到什么。Cornelis还看到加速其他功能的机会,包括:用于跨会话存储和检索模型状态的KV缓存卸载;减少混合专家(MoE)模型在推理与训练中重复传输和通信开销的MoE专家分发;面向HPC应用的消息传递接口卸载;以及训练等大型工作负载中的网络内检查点以支持故障恢复。该公司解释称,通信开销与同步会让昂贵的加速器利用率不足,而网络内加速器“允许网络在数据流经系统时对数据进行操作”。Cornelis援引其对公开数据的建模称,在10万颗GPU的系统中,约有一半GPU小时花在等待数据上,相当于每年浪费约16.8亿美元的算力容量和500 GWh电力。这类厂商自述的数字需要谨慎看待,但减少GPU闲置时间确实意味着可观的节省空间,而消除所有瓶颈远比说起来困难。

与Cornelis主攻架构标准不同,Delos Data由前Barefoot Networks与英特尔高管创立,试图从物理层切入,推出名为Nonstop AI的网络参考设计组合,覆盖从共封装互联到传统网卡的多种连接形态。其思路是为客户提供系统级蓝图,加速端点间的数据移动,并支持超越单机架的更大计算域。Delos的数据接口有三种形态:第一种是I/O die,聚合带宽超过30 Tbps,即双向约8 TB/s,是英伟达或AMD最新加速器互联带宽(上限3.6 TB/s)的两倍多。其竞争力最终取决于部署时间,而这又高度依赖集成——这些I/O die需要直接集成到加速器封装中,要求深度协同设计。关键在于,Delos不像英伟达那样把客户锁在封闭花园里:NVLink Fusion目前仍要求客户购买NVSwitch用于扩展网络,而Delos的chiplet是协议无关的,不关心客户使用ESUN、UALink还是其他协议。希望把精力与资本集中在加速器AI部分的芯片设计者——这适用于大多数超大规模云厂商——可以直接授权Delos的chiplet设计。这种协议无关性也延伸到Delos的近封装光学(NPO)技术,它将集成超过10 Tbps的数据接口(按英伟达的说法是2.5 TB/s双向带宽)与领先光学供应商的光引擎。像英伟达NVL72这样的机架级系统,此前因功耗限制主要依赖铜互联;随着系统从72 GPU机架向行级规模扩展,光学互联的重要性正在上升。

整体来看,这场竞争的核心是AI算力扩展的“连接层”。英伟达通过NVLink与NVSwitch把互联变成生态护城河,而Cornelis与Delos分别从开放架构和协议无关的物理层芯片切入,试图降低客户被单一供应商锁定的风险。对投资者而言,值得关注的是:开放互联能否在性能与功耗上真正逼近NVLink,以及超大规模云厂商是否愿意为摆脱锁定而承担协同设计的成本。若开放方案获得采用,交换机、光模块与加速器定制芯片的产业链格局可能随之变化;若NVLink Fusion继续巩固生态,英伟达在AI集群中的系统级优势仍将延续。