螞蟻百靈(inclusionAI)近日在 Hugging Face 上釋出了 LLaDA2.2-flash,這是一款面向智慧體(agent)應用的擴散語言模型,屬於 LLaDA2 系列。該模型總引數量(非嵌入層)為 100B,採用混合專家(MoE)架構,上下文視窗擴充套件至 128K 令牌,並引入了 Levenshtein 編輯機制——通過 DELETE 和 INSERT 兩種控制令牌,使擴散解碼能夠編輯序列結構、刪除冗餘內容並在並行生成過程中建立插入槽位,從而支援多輪工具呼叫、長上下文互動和穩健糾錯等智慧體場景。
在官方公佈的基準測試中,LLaDA2.2-flash 與 Ling-2.6-flash 進行了對比。在智慧體得分方面,LLaDA2.2-flash 在 τ²-Bench 上取得 80.33(Ling-2.6-flash 為 76.36),在 Claw-Eval 上為 64.22(對比 64.56),在 PinchBench 上為 81.66(對比 81.30),在 MCP-Atlas 上為 46.21(對比 41.12),均小幅領先或持平;而在 SWE-bench 系列(Verified、Pro、Multilingual)和 BFCL-V4 上則略低於對比模型。更值得關注的是吞吐量(TPS):LLaDA2.2-flash 在 SWE-bench Verified 上達到 519.0 TPS,而 Ling-2.6-flash 為 303.2;在 τ²-Bench 上為 592.8 TPS(對比 334.9);在 BFCL-V4 上為 703.82 TPS(對比 331.5),吞吐量優勢明顯。
該模型在技術層面有多項創新:通過 Block Routing 技術將 MoE 專家啟用限制在擴散塊級別,以支援高效的長上下文智慧體工作負載;提出 Levenshtein Editing ELBO-based Block-level Policy Optimization(L-EBPO),利用智慧體環境獎勵訓練多輪工具使用場景下的編輯與糾錯能力。模型以 Apache-2.0 許可證開源,並提供了基於 Hugging Face Transformers 的推理程式碼示例,建議使用 `block_length=32`、`temperature=0.0` 等預設取樣引數,並針對長上下文場景推薦使用 SGLang 作為服務後端。
LLaDA2.2-flash 的釋出標誌著擴散語言模型在智慧體應用領域邁出重要一步。相比傳統自迴歸模型,擴散模型在並行生成和編輯能力上具有獨特優勢,可能為 AI 代理、自動化工具鏈等場景帶來更高效的解決方案。對於關注模型層和基礎設施層的投資者而言,該模型的高吞吐量和開源策略有望降低部署門檻,推動更多智慧體應用的落地。