摩尔线程在2026世界人工智能大会期间披露了多项国产算力训练成果,其中最引人注目的是基于其国产万卡级集群成功训练了一款236B参数MoE模型。该模型使用25T+语料,从零起步完成了预训练到长窗口训练的全流程,有效训练时长占比超过90%。这一数字表明,国产芯片集群在训练大规模前沿模型时已具备较高的稳定性和效率。

摩尔线程高级副总裁董龙飞强调,高精度并非单次计算数值精度,而是指模型在不同GPU平台间迁移训练时的结果对齐能力。具体数据显示,在DeepSeek一类MoE模型上,与国际主流GPU对比训练,前3万步的平均相对误差控制在万分之六以内。此外,摩尔线程以500B至5T不等规模的数据做过多次实验,称基于相同卡数、模型配置和训练流程,其平台训练所得模型在下游Benchmark评测中的得分与参考平台基本一致,部分指标更高。

在具身智能领域,摩尔线程与北京大学EvoPhys团队合作训练的5D世界模型EvoPhys-World,基于MTT S5000完成全栈原生训练,在WorldScore世界生成维度连续37天排名第一。该项目获得摩尔线程“灯塔计划”支持,被视作国内首次由中国科学家在中国算力设备上完成的原创世界模型工作,具有分水岭意义。此外,北京智源研究院RoboBrain 2.5具身大脑模型,依托摩尔线程MTT S5000千卡智算集群,成功完成全流程训练,首次验证了国产算力集群在具身智能大模型训练中的高可用性。

摩尔线程创始人、董事长兼首席执行官张建中将AI产业按功能拆分为三类“工厂”:模型训练工厂、词元生产工厂、智能体生产工厂。三者共用同一套全功能GPU架构,这也是摩尔线程与专用芯片路线厂商的核心分野。在词元生产工厂方向,摩尔线程展示了基于MTT S5000的PD分离异构推理方案,将算力需求大的Prefill计算放在S5000上,将带宽需求高的Decode计算放在国际主流GPU上,异构组合后整体吞吐量较原有方案提升近2倍。董龙飞补充称,这类异构方案的性能比任何同构方案高50%以上,其中很大一部分收益来自KV Cache的调度优化,在类似OpenClaw场景下缓存命中率可达90%,相当于节省90%的算力。

过去一年,国产大模型发布后到完成硬件适配的周期已从“数月”压缩到“发布即适配”,部分大模型厂商现在会在模型规划部署阶段就与摩尔线程同步共研,而非等模型发布后才启动适配。在具身智能方面,早期VLA/VLM类模型参数在5B至14B之间,主要部署于端侧;当前世界模型路线不再依赖语言输入,直接处理物理世界,实现高质量具身控制大致需要10亿参数级别模型在端侧运行,同时配合千亿级及以上模型在云端协同。摩尔线程正基于自有万卡级集群持续进行万亿参数模型的训练验证,但未公布具体进展和时间表。

谈及算力供应,董龙飞表示,中国的算力建设是面向未来十至二十年的基础设施投入,短期供不应求属于正常现象,以铁路、高速公路等基建类比,中国GPU或算力企业远未发展到供过于求的地步。