中科曙光发布scaleFabric Token加速技术体系,并称该体系实现了IBGDA技术在国内的首次规模化应用。
根据36氪的报道,scaleFabric以原生无损RDMA高速网络为基础,构建了“算存传”三级紧耦合的Token加速超级通道。其中,支持GPU直接发起网络通信的IBGDA技术,在国内首次实现规模化落地,并已在十万卡级大规模集群中完成验证。
在生态适配方面,scaleFabric已完成DeepEP等通信框架的适配,并通过IBGDA、存储直通等技术提升Token流转效率,为国产大模型提供新的高速互连选择。
从产业角度看,大模型训练对集群内部的数据交换效率高度敏感,Token在计算、存储与网络之间的流转速度,直接影响训练任务的吞吐和稳定性。IBGDA允许GPU绕过部分传统通信路径直接发起网络通信,理论上可降低延迟、提升带宽利用率。中科曙光此次将这一技术推向规模化验证,并完成与DeepEP等框架的对接,意味着国产高速互连方案在软件生态兼容性上迈出一步。
不过,技术体系的实际性能表现、在更多模型与框架上的通用性,以及后续的部署成本与运维复杂度,仍有待更多公开信息验证。对于关注国产算力基础设施的读者而言,scaleFabric的进展提供了一个观察国产高速互连技术从实验室走向大规模集群的窗口。