隨著AI訓練叢集規模不斷攀升,物理基礎設施已成為關鍵設計考量。AFL近日釋出白皮書,聚焦如何以可擴充套件的光纖架構支撐16K-XPU規模的AI訓練叢集,在降低部署複雜度的同時,為未來算力迭代預留空間。白皮書提出了一套基於商用光連線技術的兩層Clos參考架構,並給出旨在減少未來物理改造的設計原則。

白皮書指出,當叢集規模達到16K加速器時,後端擴充套件網路的物理層設計至關重要。傳統佈線方式往往難以應對高密度光纖連線與長期演進需求。為此,AFL建議將網路物理層劃分為永久基礎設施拓撲相關連線兩部分:前者包括骨幹中繼、區域佈線和裝置跳線中的固定部分,後者則可在裝置升級或拓撲調整時靈活更換。這種分離設計使得物理網路在部署和運維上更為簡單,同時能適應未來計算代際的變化。

具體而言,參考架構展示瞭如何通過面板到面板連線工廠端接元件以及將拓撲邏輯實現在裝置跳線和區域佈線中,來構建一個既高效又靈活的物理網路。這種設計減少了現場端接工作量,降低了人為錯誤風險,並提升了整體可靠性。白皮書強調,採用商用現貨光連線技術,意味著無需定製化硬體即可實現規模化部署,從而縮短建設週期並控制成本。

從產業視角看,這份白皮書反映了AI基礎設施投資正從單純追求算力峰值,轉向關注物理層可擴充套件性與長期TCO。對於資料中心運營商和雲服務商而言,如何在當前建設階段就為下一代GPU/XPU叢集預留光纖容量和佈線結構,成為影響未來升級速度的關鍵因素。AFL的架構思路為行業提供了一種可操作的範式,即通過標準化、模組化的物理層設計,降低未來算力迭代時的改造難度。

值得注意的是,白皮書並未給出具體的效能測試資料或成本對比,而是側重於架構原則與設計方法論。這或許意味著,在16K加速器規模下,物理層設計的核心挑戰已從單純的光纖密度,轉向如何平衡永久設施的投資拓撲靈活性。對於投資者而言,這類白皮書有助於理解AI叢集建設中非計算環節的投入價值,以及光連線、佈線廠商在AI資本開支週期中的潛在受益邏輯。