蚂蚁集团旗下百灵团队于今日发布了新一代原生混合推理模型 Ling-3.0-flash。该模型总参数量为 124B,激活参数仅 5.1B,分别约为其前代 1T 级旗舰模型 Ring-2.6-1T 的 12.4% 和 8.1%,但在关键基准测试中表现持平或超越前代。这一“以小博大”的特性,使其在推理效率和部署成本上具备显著优势。
Ling-3.0-flash 采用原生混合线性架构,从预训练之初便以 5:1 的比例交替堆叠 KDA(Kimi Delta Attention) 与 MLA 层,并引入 KDA 细粒度对角门控和 1/64 稀疏 MoE 技术。模型总层数为 35 层,其中包含 2 个稠密层,路由专家数为 512,激活专家数为 8。这种设计旨在提升长上下文处理效率并降低计算成本。
在效率方面,Ling-3.0-flash 每个 token 仅激活 5.1B 参数,却提供了强大的推理、指令遵循和长上下文能力,可支撑生产环境中的复杂智能体工作流。模型原生集成了 SGLang HiCache 与 Mooncake 分层缓存架构,通过物理双池和集群共享的 L3 缓存,消除了长交互过程中的冗余重计算,在长输入场景下将首 token 延迟(TTFT)降低了 60% 至 80% 以上。
针对智能体任务,Ling-3.0-flash 在训练中融入了超过 10,000 个交互式环境,实现了编码、通用及深度研究等智能体任务的端到端闭环执行。官方表示,该模型在 Claude Code、Kilo Code、Qwen Code、Hermes Agent 和 OpenClaw 等框架中均表现出良好的用户体验。
在评测方面,Ling-3.0-flash 在代码与智能体基准测试中表现强劲,包括 SWE-Bench Pro、SWE-Bench Multilingual、Tau3-banking-AA、MCP-Atlas 和 SkillsBench 等。此外,该模型在通用知识、数学推理、指令遵循和长上下文理解方面也展现出较强实力。评测中,模型默认启用思考模式,解码参数为 temperature=0.6、top_p=0.95、top_k=20。
值得注意的是,Ling-3.0-flash 的发布标志着高效推理模型在性能与成本之间取得了新的平衡。对于 AI 产业而言,这类低激活参数模型有望降低推理阶段的算力需求,从而影响云服务提供商的成本结构,并推动更广泛的智能体应用落地。不过,其实际表现仍需在真实生产环境中进一步验证。