中國首個全鏈路國產化的十萬卡AI超叢集——曙光8000(登峰),已在鄭州正式落成並接入國家超算網際網路。這是國內首個從晶片、伺服器到交換機全部採用國產方案的十萬卡叢集,標誌著國產算力在超大規模系統工程上取得關鍵突破。

十萬張AI加速卡同時運轉的算力規模相當可觀。若全部用於模型推理,該叢集可支撐當前中國5%至10% 的Token訪問需求;若轉向科學計算,則能在一天內完成過去需要數月才能跑完的複雜模擬任務。

然而,從萬卡跨越到十萬卡,絕非簡單的算力堆疊。中科曙光高階副總裁李斌指出,算力規模每提升一個數量級,系統的工程難度、可靠性壓力和協同複雜度都會呈幾何倍數增長。任何一個部件、鏈路或排程環節的微小漏洞,在十萬卡規模下都可能被無限放大,導致整體效能坍塌。這也是此前國內長期未能實現全國產十萬卡叢集落地的核心原因。

為解決這一難題,曙光8000採用了“原生超智融合”架構。傳統方案通常將需要高精度浮點運算(FP64)的科學計算,與依賴低精度大吞吐(FP16/INT8)的大模型訓練分開部署,導致資料搬運和任務切換效率低下。而曙光8000從底層晶片到系統架構實現了一體化融合,單晶片即可覆蓋從FP64到INT8的全精度計算需求,在同一套系統內同時承接傳統超算任務與AI訓練推理。

在網路互聯層面,曙光自研了scaleFabric高速互連網路,採用類InfiniBand的原生RDMA技術,可支撐十萬卡叢集的穩定連線,並具備毫秒級鏈路故障恢復能力。李斌透露,為提升可靠性,團隊在櫃級單元內優先使用銅互聯而非光互聯,因為銅的訊號質量更好、故障率更低;只有當物理距離超出銅的驅動極限時,才會轉向矽光共封裝(CPO)技術。此外,系統還採用了浸沒式液冷來控制溫度波動,力求將每一個小部件的可靠性做到比通用計算裝置高一個數量級。

在實際應用中,超智融合架構已展現出“一套系統幹兩套活”的效率優勢。例如,8萬張卡完成了蛋白質摺疊全流程模擬,將傳統方法耗時數年的工作壓縮至數週甚至數天;9萬張卡協同完成了3.16萬億原子的DFT高精度模擬;8.8萬張卡完成了328萬億網格湍流直接模擬,這對航空發動機、船舶設計等工程研發至關重要。李斌還觀察到,在這些大規模應用中,結合機器學習AI方法的比例遠高於預期,說明國內頭部應用團隊正在快速採納AI方法。

儘管十萬卡叢集的落成是一項了不起的工程成就,但其商業考卷才剛剛開啟。中國科學院院士鄂維南近期公開表示,算力規模本身不是目的,能否讓算力真正“可用”才是關鍵。當前行業熱議的“算力泡沫”焦慮,本質是對算力價值落地難的擔憂。曙光8000的實戰表現則印證了結構性算力緊缺的現狀:市場閒置的多為低端通用算力,而適配AI for Science、高階工業模擬和大模型深度訓練的高穩定性國產優質算力,長期供不應求。尤其在2026年智慧體應用全面爆發、AI產業進入推理時代的背景下,十萬卡級大規模算力的剛需屬性正持續凸顯。

據企業官方資訊,中科曙光已與北京科學智慧研究院達成合作,啟動第二套十萬卡系統的研製與建設。從“第一套”到“第二套”的快速決策,顯示出建設方對技術路線的信心。但十萬卡叢集要從示範工程走向商業可複製,仍需回答幾個關鍵問題:大模型的軟體工程化能力能否跟上硬體擴張速度,避免出現類似馬斯克的xAI部署約55萬張GPU但浮點運算利用率僅11% 的困境;推理需求的增長能否持續消化新增算力供給;以及在全生命週期成本上能否形成商業閉環。

李斌坦言,國產晶片單點能力與全球頂尖水平尚有差距,但可以通過更多晶片和更優的系統效率來彌補。曙光8000的意義不在於規模有多大,而在於它證明了中國有能力將超大規模算力組織起來、穩定執行並開放服務,這或許才是下一階段AI應用競爭的真正入場券。