AI基礎設施正面臨一個被忽視的瓶頸:交換機。Data Center Knowledge發表的一篇評論文章指出,儘管算力晶片效能持續飆升,但網路能力的提升並未同步跟上,導致全球最先進的GPU大量時間處於閒置狀態。
文章援引一項針對模型浮點運算利用率的研究資料稱,在萬億引數級大模型訓練中,AI實驗室在Nvidia H100上僅實現了35%-40%的模型浮點運算利用率。這意味著,這些價格高昂的晶片有超過一半的時間並非在計算,而是在等待資料通過網路傳輸到位。網路結構已經成為制約AI系統實際能力的關鍵約束。
這一瓶頸的根源在於,AI訓練叢集正從數百張GPU擴充套件至數千張GPU,網路挑戰已從單純的連線速率轉向交換結構如何高效協調所有節點間的資料移動。文章作者Mark Rushworth指出,AI訓練工作負載的頻寬需求已從400 Gb/s邁向800 Gb/s,1.6 Tb/s的線速也被提上近期路線圖,但原始鏈路速度只是問題的一部分。更艱鉅的工程挑戰在於,如何在超大規模叢集中實現低延遲、無擁塞的資料排程。
網路技術必須在2027年前達到1.6 Tb/s線速目標。若錯過這一視窗期,整個生態系統將被迫尋找繞行方案。這一緊迫性正在重塑資料中心的投資結構。文章預計,網路裝置在資料中心資本支出中的佔比將從目前的5%-10%顯著上升至2030年的15%-20%,網路已不再是配角,而是決定AI基礎設施成本、能效和競爭力的首要因素。
從產業鏈角度看,這一趨勢將直接利好高階交換機、光模組和互聯晶片供應商。當昂貴的GPU因網路延遲而空轉時,單純堆砌算力已無法線性提升訓練效率,最佳化網路架構成為釋放算力潛力的前提。對於AI投資者而言,關注點正從“誰擁有最多GPU”轉向“誰的網路能最有效地讓GPU保持忙碌”,網路環節的價值重估或將成為AI基礎設施投資的下一個重要敘事。