蚂蚁集团旗下百灵(inclusionAI)近日在 Hugging Face 平台发布了 LLaDA2.2-flash,这是一款面向智能体(agentic)应用的扩散语言模型,属于 LLaDA2 系列。该模型采用混合专家(MoE)架构,非嵌入参数规模为 100B,上下文窗口扩展至 128K,并引入了 Levenshtein 编辑机制(通过 DELETE 和 INSERT 控制符),使扩散解码能够编辑序列结构、删除冗余内容并在并行生成中创建插入槽位,从而支持长上下文工具使用、多轮交互和稳健的错误修正。模型以 Apache 2.0 许可开源,并已在 ModelScope 同步上线,方便中国大陆用户访问。

在官方公布的基准测试中,LLaDA2.2-flash 与同系列或竞品模型 Ling-2.6-flash 进行了对比。在智能体基准得分上,LLaDA2.2-flash 在 SWE-bench Verified 上取得 49.28 分(对比 Ling-2.6-flash 的 61.20 分),在 τ²-Bench 上取得 80.33 分(对比 76.36 分),在 MCP-Atlas 上取得 46.21 分(对比 41.12 分),在 PinchBench 上取得 81.66 分(对比 81.30 分)。不过,在 SWE-bench Pro、SWE-bench Multilingual 和 BFCL-V4 等基准上,LLaDA2.2-flash 得分略低于对比模型。值得注意的是,Ling-2.6-flash 的部分分数来自其技术报告(使用 OpenHands 脚手架),而 LLaDA2.2-flash 的 SWE-bench 系列评估则使用了 Claude Code 脚手架,两者评估环境存在差异。

在吞吐量(TPS)方面,LLaDA2.2-flash 表现突出:在 SWE-bench Verified 上达到 519.0 TPS,而 Ling-2.6-flash 为 303.2 TPS;在 τ²-Bench 上为 592.8 TPS(对比 334.9 TPS);在 BFCL-V4 上为 703.82 TPS(对比 331.5 TPS)。官方表示,Ling-2.6-flash 的评估启用了 MTP(多 token 预测)并设置 4 个草稿 token,而 LLaDA2.2-flash 的评估配置为 128K 上下文、温度 1.0、block_length=32、threshold=0.5、editing_threshold=0.0,每个分数为五次运行的平均值。

技术上,LLaDA2.2-flash 引入了三项关键创新:Block Routing 在扩散块级别限制 MoE 专家激活,以支持高效的长上下文智能体工作负载;Levenshtein 编辑通过 DELETE 和 INSERT 控制符实现序列结构编辑;L-EBPO(基于 Levenshtein 编辑 ELBO 的块级策略优化)利用智能体环境奖励来训练多轮工具使用场景中的编辑和错误修正。模型配置包括 32 层、32 个注意力头、旋转位置编码(RoPE)和 157,184 的词汇表大小。

对于 AI 产业观察者而言,LLaDA2.2-flash 的意义在于它展示了扩散语言模型在智能体应用上的潜力,尤其是其高吞吐量和长上下文能力,可能为模型层带来新的效率选择。不过,其部分基准得分仍低于对比模型,且评估环境差异需谨慎看待。该模型的发布也反映了中国科技公司在开源模型领域的持续投入,蚂蚁百灵通过 Hugging Face 和 ModelScope 双平台分发,降低了全球开发者的使用门槛。未来,随着更多技术细节在即将发布的报告中披露,其实际性能和应用场景将得到更全面的评估。