随着AI训练集群规模不断攀升,物理基础设施已成为关键设计考量。AFL近日发布白皮书,聚焦如何以可扩展的光纤架构支撑16K-XPU规模的AI训练集群,在降低部署复杂度的同时,为未来算力迭代预留空间。白皮书提出了一套基于商用光连接技术的两层Clos参考架构,并给出旨在减少未来物理改造的设计原则。

白皮书指出,当集群规模达到16K加速器时,后端扩展网络的物理层设计至关重要。传统布线方式往往难以应对高密度光纤连接与长期演进需求。为此,AFL建议将网络物理层划分为永久基础设施拓扑相关连接两部分:前者包括骨干中继、区域布线和设备跳线中的固定部分,后者则可在设备升级或拓扑调整时灵活更换。这种分离设计使得物理网络在部署和运维上更为简单,同时能适应未来计算代际的变化。

具体而言,参考架构展示了如何通过面板到面板连接工厂端接组件以及将拓扑逻辑实现在设备跳线和区域布线中,来构建一个既高效又灵活的物理网络。这种设计减少了现场端接工作量,降低了人为错误风险,并提升了整体可靠性。白皮书强调,采用商用现货光连接技术,意味着无需定制化硬件即可实现规模化部署,从而缩短建设周期并控制成本。

从产业视角看,这份白皮书反映了AI基础设施投资正从单纯追求算力峰值,转向关注物理层可扩展性与长期TCO。对于数据中心运营商和云服务商而言,如何在当前建设阶段就为下一代GPU/XPU集群预留光纤容量和布线结构,成为影响未来升级速度的关键因素。AFL的架构思路为行业提供了一种可操作的范式,即通过标准化、模块化的物理层设计,降低未来算力迭代时的改造难度。

值得注意的是,白皮书并未给出具体的性能测试数据或成本对比,而是侧重于架构原则与设计方法论。这或许意味着,在16K加速器规模下,物理层设计的核心挑战已从单纯的光纤密度,转向如何平衡永久设施的投资拓扑灵活性。对于投资者而言,这类白皮书有助于理解AI集群建设中非计算环节的投入价值,以及光连接、布线厂商在AI资本开支周期中的潜在受益逻辑。