蚂蚁集团旗下百灵(inclusionAI)今日在 Hugging Face 等平台开源了 Ling-3.0 系列语言基础模型,主打高效与稀疏 MoE 架构,并同步发布训练过程中的多个检查点,以支持社区研究与二次开发。其中旗舰基础模型 Ling-3.0-flash-base 总参数达 124B,但每个 token 仅激活 5.1B 参数,显著降低了推理时的计算开销。

Ling-3.0 系列采用高度稀疏的 MoE 架构,共设 512 个路由专家,每个 token 仅激活其中 8 个路由专家1 个共享专家,从而在保持模型能力的同时大幅减少激活参数。此外,该系列从预训练之初就原生采用混合线性注意力架构,结合 KDA 与 Gated MLA,以高效处理长上下文输入。这种设计有望在长文本任务中降低计算复杂度,提升推理效率。

除了最终的基础模型,百灵还发布了训练过程中的多个检查点,包括预训练检查点、中期训练检查点以及经过 WSM 合并(即学习率衰减替代方案)的合并检查点。这些检查点分别对应训练的不同阶段,旨在支持继续预训练、微调、偏好优化、蒸馏研究以及长上下文和 MoE 系统研究。值得注意的是,Ling-3.0-tiny-base 与 Ling-3.0-flash-base 共享相同的训练配方,社区可以先在小模型上实验,再将验证过的训练策略扩展到更大模型,实现无缝规模扩展。

在模型规格上,Ling-3.0-flash-base 包含 35 层 KDA7 层 Gated MLA(比例为 5:1),隐藏层大小 2560,专家中间尺寸 768,词表大小 157,184。模型以 MIT 许可 开源,允许自由使用、修改和分发,这为研究者和开发者提供了极大的灵活性。

百灵在发布说明中强调,这些基础模型适合用于继续预训练、中期训练、监督微调、偏好优化、蒸馏研究等场景,但不建议直接用于面向终端用户的聊天部署,也不建议在未进行额外对齐和评估的情况下用于安全关键应用。这反映出开源基础模型与后训练模型之间的明确分工,后训练版本(如 Ling-3.0-tiny 和 Ling-3.0-flash)可能更适合实际应用。

从产业视角看,Ling-3.0 系列的开源对 AI 模型层和基础设施层都有潜在影响。高效 MoE 架构与线性注意力的结合,有望降低推理成本,使中小企业和研究者能够以更低门槛部署大模型,这可能加剧开源模型与闭源模型的竞争。同时,蚂蚁集团作为中国科技巨头,其开源动作也体现了国内大模型生态的活跃度,对关注 AI 产业链的投资者而言,这标志着模型层技术路线多样化和成本下降的趋势。不过,模型的实际性能与生态采用情况仍需后续评估。