AI叢集的擴充套件正面臨新的瓶頸——網路。當資料中心內GPU數量增至數千塊時,若網路架構無法提供可預測的頻寬和低尾部延遲,鉅額硬體投資可能付諸東流。思科、博通和輝達等廠商正競相推出51.2-102.4Tbps級乙太網路交換晶片,以應對這一挑戰。
Dell'Oro Group研究副總裁Sameh Boujelbene直言:“在AI資料中心,網路正成為叢集效率的主要決定因素。一家公司可能在GPU上花費數十億美元,但如果網路無法提供可預測的頻寬和低延遲,他們買到的不是AI超級計算機,而是一堆昂貴的閒置晶片。”這一觀點凸顯了網路在AI基礎設施中的核心地位。
AI基礎設施的擴充套件通常沿三個維度展開:Scale up(向上擴充套件)通過高頻寬節點內連線,在單個伺服器或機架內堆疊更多算力;Scale out(向外擴充套件)增加機架數量,整合資源以執行更大模型或併發任務;Scale across(跨區擴充套件)則通過光網路連線多個數據中心,實現跨區域的叢集協同。每個維度對網路提出不同要求,從機架內延遲到廣域緩衝和遙測能力,不一而足。
在晶片層面,思科推出了新的Silicon One G300和P200晶片,面向AI網路需求設計。博通的Tomahawk 6和輝達的Spectrum-6同樣瞄準這一市場。這些晶片普遍採用更深的資料包緩衝、更豐富的遙測功能以及先進的負載均衡策略,旨在保持GPU高利用率的同時,縮短作業完成時間。
對於AI叢集而言,網路效能直接影響訓練效率。突發性的集體通訊流量(如梯度同步)需要網路具備高吞吐和低延遲特性,否則GPU將因等待資料而閒置,造成算力浪費。因此,網路晶片的升級不僅是頻寬的提升,更是對整體叢集效率的最佳化。
從產業角度看,網路晶片的競爭格局正在重塑。思科憑藉其在企業網路領域的積累,試圖在AI資料中心市場佔據一席之地;博通則依託其交換晶片的廣泛部署,持續迭代Tomahawk系列;輝達則通過Spectrum系列,將其GPU生態與網路方案深度繫結,形成端到端的AI基礎設施解決方案。
隨著AI模型規模持續擴大,資料中心網路的重要性將愈發凸顯。無論是超大規模雲服務商還是企業級AI部署,網路都將是決定算力投資回報的關鍵環節。未來,網路晶片的技術路線和生態競爭,將深刻影響AI基礎設施的發展方向。