摩爾線程在2026世界人工智慧大會期間披露了多項國產算力訓練成果,其中最引人注目的是基於其國產萬卡級叢集成功訓練了一款236B引數的MoE模型。該模型使用25T+語料,從零起步完成了預訓練到長視窗訓練的全流程,有效訓練時長佔比超過90%。這一數字表明,國產晶片叢集在訓練大規模前沿模型時已具備較高的穩定性和效率。
摩爾線程高階副總裁董龍飛強調,高精度並非單次計算數值精度,而是指模型在不同GPU平台間遷移訓練時的結果對齊能力。具體資料顯示,在DeepSeek一類MoE模型上,與國際主流GPU對比訓練,前3萬步的平均相對誤差控制在萬分之六以內。此外,摩爾線程以500B至5T不等規模的資料做過多次實驗,稱基於相同卡數、模型配置和訓練流程,其平台訓練所得模型在下游Benchmark評測中的得分與參考平台基本一致,部分指標更高。
在具身智慧領域,摩爾線程與北京大學EvoPhys團隊合作訓練的5D世界模型EvoPhys-World,基於MTT S5000完成全棧原生訓練,在WorldScore世界生成維度連續37天排名第一。該專案獲得摩爾線程“燈塔計劃”支援,被視作國內首次由中國科學家在中國算力裝置上完成的原創世界模型工作,具有分水嶺意義。此外,北京智源研究院的RoboBrain 2.5具身大腦模型,依託摩爾線程MTT S5000千卡智算叢集,成功完成全流程訓練,首次驗證了國產算力叢集在具身智慧大模型訓練中的高可用性。
摩爾線程創始人、董事長兼執行長張建中將AI產業按功能拆分為三類“工廠”:模型訓練工廠、詞元生產工廠、智慧體生產工廠。三者共用同一套全功能GPU架構,這也是摩爾線程與專用晶片路線廠商的核心分野。在詞元生產工廠方向,摩爾線程展示了基於MTT S5000的PD分離異構推理方案,將算力需求大的Prefill計算放在S5000上,將頻寬需求高的Decode計算放在國際主流GPU上,異構組合後整體吞吐量較原有方案提升近2倍。董龍飛補充稱,這類異構方案的效能比任何同構方案高50%以上,其中很大一部分收益來自KV Cache的排程最佳化,在類似OpenClaw場景下快取命中率可達90%,相當於節省90%的算力。
過去一年,國產大模型釋出後到完成硬體適配的週期已從“數月”壓縮到“釋出即適配”,部分大模型廠商現在會在模型規劃部署階段就與摩爾線程同步共研,而非等模型釋出後才啟動適配。在具身智慧方面,早期VLA/VLM類模型引數在5B至14B之間,主要部署於端側;當前世界模型路線不再依賴語言輸入,直接處理物理世界,實現高質量具身控制大致需要10億引數級別模型在端側執行,同時配合千億級及以上模型在雲端協同。摩爾線程正基於自有萬卡級叢集持續進行萬億引數模型的訓練驗證,但未公佈具體進展和時間表。
談及算力供應,董龍飛表示,中國的算力建設是面向未來十至二十年的基礎設施投入,短期供不應求屬於正常現象,以鐵路、高速公路等基建類比,中國GPU或算力企業遠未發展到供過於求的地步。