AI集群的扩展正面临新的瓶颈——网络。当数据中心内GPU数量增至数千块时,若网络架构无法提供可预测的带宽和低尾部延迟,巨额硬件投资可能付诸东流。思科、博通和英伟达等厂商正竞相推出51.2-102.4Tbps级以太网交换芯片,以应对这一挑战。
Dell'Oro Group研究副总裁Sameh Boujelbene直言:“在AI数据中心,网络正成为集群效率的主要决定因素。一家公司可能在GPU上花费数十亿美元,但如果网络无法提供可预测的带宽和低延迟,他们买到的不是AI超级计算机,而是一堆昂贵的闲置芯片。”这一观点凸显了网络在AI基础设施中的核心地位。
AI基础设施的扩展通常沿三个维度展开:Scale up(向上扩展)通过高带宽节点内连接,在单个服务器或机架内堆叠更多算力;Scale out(向外扩展)增加机架数量,整合资源以运行更大模型或并发任务;Scale across(跨区扩展)则通过光网络连接多个数据中心,实现跨区域的集群协同。每个维度对网络提出不同要求,从机架内延迟到广域缓冲和遥测能力,不一而足。
在芯片层面,思科推出了新的Silicon One G300和P200芯片,面向AI网络需求设计。博通的Tomahawk 6和英伟达的Spectrum-6同样瞄准这一市场。这些芯片普遍采用更深的数据包缓冲、更丰富的遥测功能以及先进的负载均衡策略,旨在保持GPU高利用率的同时,缩短作业完成时间。
对于AI集群而言,网络性能直接影响训练效率。突发性的集体通信流量(如梯度同步)需要网络具备高吞吐和低延迟特性,否则GPU将因等待数据而闲置,造成算力浪费。因此,网络芯片的升级不仅是带宽的提升,更是对整体集群效率的优化。
从产业角度看,网络芯片的竞争格局正在重塑。思科凭借其在企业网络领域的积累,试图在AI数据中心市场占据一席之地;博通则依托其交换芯片的广泛部署,持续迭代Tomahawk系列;英伟达则通过Spectrum系列,将其GPU生态与网络方案深度绑定,形成端到端的AI基础设施解决方案。
随着AI模型规模持续扩大,数据中心网络的重要性将愈发凸显。无论是超大规模云服务商还是企业级AI部署,网络都将是决定算力投资回报的关键环节。未来,网络芯片的技术路线和生态竞争,将深刻影响AI基础设施的发展方向。