蚂蚁集团旗下inclusionAI于近日在Hugging Face等平台发布了新一代原生混合推理模型Ling-3.0-flash。该模型总参数量为124B,但激活参数仅5.1B,分别约为其前代旗舰模型Ring-2.6-1T的12.4%和8.1%。官方表示,Ling-3.0-flash在关键基准测试中匹配或超越了前代产品,同时大幅提升了计算效率和长上下文处理能力。
Ling-3.0-flash采用了原生混合线性注意力架构,从预训练之初即采用5:1交替堆叠的Kimi Delta Attention(KDA)与MLA结构,并升级了KDA的细粒度对角门控和1/64稀疏MoE。模型总参数量124B,激活参数5.1B,包含35层KDA和7层门控MLA,以及2个稠密层、512个路由专家和1个共享专家,每次激活8个专家。这种设计旨在实现长上下文效率与计算成本的协同提升。
在效率方面,Ling-3.0-flash每token仅激活5.1B参数,却提供了强大的推理、指令跟随和长上下文能力,官方称其性能可媲美更大规模的SOTA模型和前代旗舰。模型专为生产环境中的复杂智能体工作流设计,集成了SGLang HiCache与Mooncake分层缓存架构,通过物理双池和集群共享L3缓存,消除了长交互过程中的冗余重计算,在长输入场景下将首Token延迟(TTFT)降低60%至80%以上。
针对智能体任务,Ling-3.0-flash整合了10,000多个交互式训练环境,实现编码、通用和深度研究等智能体任务的端到端闭环执行。官方在多个权威基准上进行了评估,包括SWE-Bench Pro、SWE-Bench Multilingual、Tau3-banking-AA、MCP-Atlas和SkillsBench等,模型在这些代码与智能体基准上表现强劲。此外,模型在Claude Code、Kilo Code、Qwen Code、Hermes Agent和OpenClaw等框架中均提供了良好的用户体验。
除智能体任务外,Ling-3.0-flash在通用知识、数学推理、指令跟随和长上下文理解方面也表现优异。模型默认启用思考模式,默认参数为temperature=0.6、top_p=0.95、top_k=20。上下文训练计划覆盖8K至256K长度。
Ling-3.0-flash的发布体现了AI模型向高效、低成本推理方向发展的趋势。通过极低的激活参数实现高性能,有助于降低推理成本,使复杂AI应用在生产环境中更易部署。该模型对依赖大规模算力的基础设施层和追求成本效益的模型层均有潜在影响,可能推动更多企业采用类似的高效架构。目前模型已在Hugging Face、ModelScope和OpenRouter等平台开放,采用MIT许可。