蚂蚁集团旗下 inclusionAI 于 Hugging Face 发布了 Ling-3.0-flash-dspark,这是一个专为 Ling-3.0-flash 设计的 DSpark 投机解码草稿模型,参数量约 1.36B,采用 BF16 精度。该模型通过 SpecForge 训练,并支持 SGLang 推理框架,旨在加速目标模型的文本生成过程。
投机解码是一种通过小模型快速生成草稿 token,再由大模型并行验证的技术,可显著降低推理延迟。DSpark 在 DFlash 基础上引入了目标模型的辅助特征,并配备了一个置信度头,能够动态决定生成的草稿 token 数量,从而在保证生成质量的同时提升解码效率。
模型规格方面,Ling-3.0-flash-dspark 拥有 5 层全注意力层,隐藏层大小为 2,560,采用多头注意力机制,包含 32 个查询头和 32 个键值头。其最大位置嵌入长度为 262,144,能够处理长上下文。草稿块大小为 8 个 token,验证宽度为 9(包含目标奖励 token)。
在性能评估中,该模型在多个基准测试上展现了平均接受长度(即每次投机验证步骤中平均接受的 token 数,含目标奖励 token)的优异表现:GSM8K 上为 6.40,MATH-500 为 6.29,AIME 2025 为 5.56,HumanEval 为 6.57,MBPP 为 6.34,LiveCodeBench 为 5.33,MT-Bench 为 3.92,Alpaca 为 3.51,Arena-Hard-v2 为 3.72。九个工作负载的平均接受长度为 5.29。
部署方面,用户需使用支持 DSPARK 的 SGLang 版本,并替换模型路径及张量并行大小等参数。这一发布反映了 AI 推理优化领域的持续创新,通过投机解码技术,开发者可以在不牺牲输出质量的前提下,提升模型响应速度,降低计算成本。对于 AI 产业链而言,这类技术有助于缓解算力瓶颈,推动大模型在更多实时应用场景中的落地。