蚂蚁百灵(inclusionAI)近日在 Hugging Face 上发布了 LLaDA2.2-flash,这是一款面向智能体(agent)应用的扩散语言模型,属于 LLaDA2 系列。该模型总参数量(非嵌入层)为 100B,采用混合专家(MoE)架构,上下文窗口扩展至 128K 令牌,并引入了 Levenshtein 编辑机制——通过 DELETE 和 INSERT 两种控制令牌,使扩散解码能够编辑序列结构、删除冗余内容并在并行生成过程中创建插入槽位,从而支持多轮工具调用、长上下文交互和稳健纠错等智能体场景。
在官方公布的基准测试中,LLaDA2.2-flash 与 Ling-2.6-flash 进行了对比。在智能体得分方面,LLaDA2.2-flash 在 τ²-Bench 上取得 80.33(Ling-2.6-flash 为 76.36),在 Claw-Eval 上为 64.22(对比 64.56),在 PinchBench 上为 81.66(对比 81.30),在 MCP-Atlas 上为 46.21(对比 41.12),均小幅领先或持平;而在 SWE-bench 系列(Verified、Pro、Multilingual)和 BFCL-V4 上则略低于对比模型。更值得关注的是吞吐量(TPS):LLaDA2.2-flash 在 SWE-bench Verified 上达到 519.0 TPS,而 Ling-2.6-flash 为 303.2;在 τ²-Bench 上为 592.8 TPS(对比 334.9);在 BFCL-V4 上为 703.82 TPS(对比 331.5),吞吐量优势明显。
该模型在技术层面有多项创新:通过 Block Routing 技术将 MoE 专家激活限制在扩散块级别,以支持高效的长上下文智能体工作负载;提出 Levenshtein Editing ELBO-based Block-level Policy Optimization(L-EBPO),利用智能体环境奖励训练多轮工具使用场景下的编辑与纠错能力。模型以 Apache-2.0 许可证开源,并提供了基于 Hugging Face Transformers 的推理代码示例,建议使用 `block_length=32`、`temperature=0.0` 等默认采样参数,并针对长上下文场景推荐使用 SGLang 作为服务后端。
LLaDA2.2-flash 的发布标志着扩散语言模型在智能体应用领域迈出重要一步。相比传统自回归模型,扩散模型在并行生成和编辑能力上具有独特优势,可能为 AI 代理、自动化工具链等场景带来更高效的解决方案。对于关注模型层和基础设施层的投资者而言,该模型的高吞吐量和开源策略有望降低部署门槛,推动更多智能体应用的落地。