螞蟻集團旗下百靈(inclusionAI)近日在 Hugging Face 平台釋出了 LLaDA2.2-flash,這是一款面向智慧體(agentic)應用的擴散語言模型,屬於 LLaDA2 系列。該模型採用混合專家(MoE)架構,非嵌入引數規模為 100B,上下文視窗擴充套件至 128K,並引入了 Levenshtein 編輯機制(通過 DELETE 和 INSERT 控制符),使擴散解碼能夠編輯序列結構、刪除冗餘內容並在並行生成中建立插入槽位,從而支援長上下文工具使用、多輪互動和穩健的錯誤修正。模型以 Apache 2.0 許可開源,並已在 ModelScope 同步上線,方便中國大陸使用者訪問。

在官方公佈的基準測試中,LLaDA2.2-flash 與同系列或競品模型 Ling-2.6-flash 進行了對比。在智慧體基準得分上,LLaDA2.2-flash 在 SWE-bench Verified 上取得 49.28 分(對比 Ling-2.6-flash 的 61.20 分),在 τ²-Bench 上取得 80.33 分(對比 76.36 分),在 MCP-Atlas 上取得 46.21 分(對比 41.12 分),在 PinchBench 上取得 81.66 分(對比 81.30 分)。不過,在 SWE-bench Pro、SWE-bench Multilingual 和 BFCL-V4 等基準上,LLaDA2.2-flash 得分略低於對比模型。值得注意的是,Ling-2.6-flash 的部分分數來自其技術報告(使用 OpenHands 腳手架),而 LLaDA2.2-flash 的 SWE-bench 系列評估則使用了 Claude Code 腳手架,兩者評估環境存在差異。

在吞吐量(TPS)方面,LLaDA2.2-flash 表現突出:在 SWE-bench Verified 上達到 519.0 TPS,而 Ling-2.6-flash 為 303.2 TPS;在 τ²-Bench 上為 592.8 TPS(對比 334.9 TPS);在 BFCL-V4 上為 703.82 TPS(對比 331.5 TPS)。官方表示,Ling-2.6-flash 的評估啟用了 MTP(多 token 預測)並設定 4 個草稿 token,而 LLaDA2.2-flash 的評估配置為 128K 上下文、溫度 1.0、block_length=32、threshold=0.5、editing_threshold=0.0,每個分數為五次執行的平均值。

技術上,LLaDA2.2-flash 引入了三項關鍵創新:Block Routing 在擴散塊級別限制 MoE 專家啟用,以支援高效的長上下文智慧體工作負載;Levenshtein 編輯通過 DELETE 和 INSERT 控制符實現序列結構編輯;L-EBPO(基於 Levenshtein 編輯 ELBO 的塊級策略最佳化)利用智慧體環境獎勵來訓練多輪工具使用場景中的編輯和錯誤修正。模型配置包括 32 層、32 個注意力頭、旋轉位置編碼(RoPE)和 157,184 的詞彙表大小。

對於 AI 產業觀察者而言,LLaDA2.2-flash 的意義在於它展示了擴散語言模型在智慧體應用上的潛力,尤其是其高吞吐量和長上下文能力,可能為模型層帶來新的效率選擇。不過,其部分基準得分仍低於對比模型,且評估環境差異需謹慎看待。該模型的釋出也反映了中國科技公司在開源模型領域的持續投入,螞蟻百靈通過 Hugging Face 和 ModelScope 雙平台分發,降低了全球開發者的使用門檻。未來,隨著更多技術細節在即將釋出的報告中披露,其實際效能和應用場景將得到更全面的評估。