蚂蚁集团旗下 inclusionAI 于近日发布了 Ling-3.0-tiny,一款主打轻量级部署的原生混合推理模型。该模型总参数为 7.9B,但在推理时仅激活 1.3B 参数,旨在降低推理所需的计算资源,并推动模型在本地和边缘设备上的应用。
Ling-3.0-tiny 采用了与 Ling-3.0 系列一脉相承的混合线性注意力架构,具体为 3:1 的 KDA(Kimi Delta Attention)与 MLA(Multi-Head Latent Attention)交替堆叠,即每四层中包含三层 KDA 和一层 MLA。这种设计旨在提升长上下文处理效率。同时,模型集成了包含 128 个路由专家的稀疏 MoE(混合专家)结构,每个 token 仅激活其中 8 个路由专家和 1 个共享专家,从而在保持较强能力的同时,将激活参数控制在较低水平。
该模型的一个核心特点是支持原生混合推理,即能够根据请求内容在快速响应和深度多步推理之间灵活切换。开发者可通过 `enable_thinking` 参数按请求配置思考模式,这使其在通用智能体任务、工具调用、数学与科学推理以及指令遵循等场景中表现均衡。
为适应不同部署环境,Ling-3.0-tiny 提供了 BF16、FP8 和 INT4 三种精度版本。其中 BF16 适用于高精度评估,FP8 可在吞吐与资源占用间取得平衡,而 INT4 则面向资源受限的边缘设备。这种多精度策略降低了开发者根据硬件条件进行选择的门槛。
在性能评测方面,Ling-3.0-tiny 在 Artificial Analysis Intelligence Index v4.1.1 上得分为 25,在 Artificial Analysis Agentic Index 上得分为 16。据 Artificial Analysis 测试,该模型输出速度超过 160 tokens/s,生成 500 tokens 的端到端延迟约为 18 秒(包含推理模型的思考时间),显示出在能力、激活参数规模与响应效率之间的平衡。
从产业视角看,Ling-3.0-tiny 的发布体现了当前 AI 模型发展的一个重要趋势:在追求性能的同时,越来越注重推理效率与部署灵活性。对于 AI 产业链而言,这类轻量级模型有助于降低推理成本,使更多应用场景能够负担得起 AI 能力,尤其是在资源受限的本地或边缘环境中。这可能对算力需求结构产生影响,推动市场对高效推理芯片和优化部署方案的需求。
蚂蚁集团通过 inclusionAI 推出该模型,也反映了国内科技公司在开源模型领域的持续投入。Ling-3.0-tiny 已上线 Hugging Face、ModelScope 和 OpenRouter 等平台,采用 MIT 许可,开发者可自由使用和修改。随着此类模型的普及,AI 应用有望从云端向边缘延伸,为智能终端、物联网设备等带来更实时的智能体验。