蚂蚁百灵(inclusionAI)于 Hugging Face 发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B,约为其前代 1T 级旗舰 Ring-2.6-1T12.4%8.1%。官方称,该模型在关键基准上匹配或超越前代,同时显著提升长上下文处理效率与计算成本效益。

Ling-3.0-flash 采用原生混合线性架构,从预训练开始即交替堆叠 KDA(Kimi Delta Attention)MLA,比例为 5:1,并引入 KDA 细粒度对角门控和 1/64 稀疏 MoE。模型共 35 层 KDA 与 7 层门控 MLA,包含 512 个路由专家和 1 个共享专家,每次激活 8 个专家。这种设计旨在实现长上下文效率与计算成本的协同提升。

在性能方面,Ling-3.0-flash 激活参数仅 5.1B,但官方称其在推理、指令遵循和长上下文能力上表现突出,可支持生产环境中的复杂智能体工作流。模型原生集成了 SGLang HiCacheMooncake 分层缓存架构,具备物理双池和集群共享 L3 缓存,可消除长时交互中的冗余重计算,在长输入场景下将首 token 延迟(TTFT)降低 60% 至 80% 以上

针对智能体任务,Ling-3.0-flash 集成了 10,000+ 交互训练环境,覆盖编码、通用和深度研究等任务,实现端到端闭环执行。官方在多个基准上进行了评估,包括 SWE-Bench ProSWE-Bench MultilingualTau3-banking-AAMCP-AtlasSkillsBench 等,并称其在 Claude Code、Kilo Code、Qwen Code 等框架中提供良好体验。此外,模型在通用知识、数学推理、指令遵循和长上下文理解方面也有不错表现。

模型支持256K 上下文窗口,默认启用思考模式,默认参数为 temperature=0.6、top_p=0.95、top_k=20。官方还提供了 FP8、INT4 和 FP4 等量化版本,其中 FP8 采用块级量化,INT4/FP4 采用分组量化。

Ling-3.0-flash 的发布体现了高效推理模型的发展趋势:以更少的激活参数实现接近旗舰模型的性能,有助于降低推理成本、提升部署效率,对 AI 应用的规模化落地具有积极意义。对于关注 AI 产业链的投资者而言,这类模型可能影响算力需求结构,推动更高效的推理优化方案。