在2026年世界人工智能大会(WAIC)上,中科曙光正式亮相了国产首个十万卡量级AI超集群系统——曙光8000(登峰)。该系统于7月在光合组织2026智能计算应用大会期间落成,一周后即在WAIC进行真机展示,也是国内首台明确采用“超智融合”技术路线的系统。
根据曙光8000公布的最新运行数据,集群上线后市场需求火爆,首周即实现应用满载运行。目前日均处理作业数突破15万个,单日处理作业峰值超过50万个。中科曙光高级副总裁李斌曾表示,若全部算力用于推理,曙光8000将成为中国最大的Token工厂,能支撑当前全国5%~10%的Token需求。
曙光8000的任务覆盖广泛,从万亿级参数大模型的训练和高通量推理,到超过300余个重点科学工程计算应用,再到AI4S(AI for Science)的前沿探索。集群还为下一代十万亿参数大模型预留了空间。
十万卡集群的工程挑战
集群规模从万卡跃升至十万卡,工程复杂度呈指数级攀升。李斌将核心挑战归结为性能效率与可靠性。在Scale-Up层面,中科曙光将640张加速卡集成于单个机柜内,采用铜互联以降低时延和功耗。在机柜间,自研400G高速网卡和880G交换芯片,构建国产原生RDMA高速互连网络Scale Fabric,实现十万卡规模下的高带宽、低时延通信。李斌表示,Scale Fabric未来有能力实现对InfiniBand的全面国产化替代。
可靠性方面,十万卡集群元器件数量增加十倍,潜在故障点翻倍。曙光从最微小部件到每块板卡,将单点可靠性提高一个数量级,并采用相变浸没式液冷技术,使系统运行在恒定稳定环境中,大幅提高整机可靠性。
“超智融合”路线与科学计算
曙光8000的“超智融合”路线并非在不同机房分别部署超算和智算设备,而是让同一个计算单元同时覆盖科学工程计算与神经网络计算。系统支持从FP64到INT8的多种计算精度,底层平台由6款达到国际先进水平的核心国产芯片、存储和互连系统等部件构成。
目前,曙光8000已与国内大模型团队合作完成语言模型、语义模型和世界模型的万卡级预训练,并为超过400个主流模型提供线上推理服务。超过300项超智融合应用优化覆盖大模型、机器人、创新药、天文气象等二十余领域,其中70余项已完成万卡规模扩展。超过40%的AI4S项目已结合机器学习方法。
李斌透露,曙光还将与北京科学智能研究院启动第二套全国产十万卡超智融合系统,下一代将更聚焦AI4S,以换取对科学任务更有针对性的支持。