螞蟻集團旗下百靈實驗室於2026年9月4日釋出LLaDA-Image系列開源影像生成與編輯模型,並同步公開模型權重與推理程式碼。該系列包含LLaDA-Image(Base版)與LLaDA-Image-Turbo(Turbo版),引數規模約6B,採用統一的擴散模型架構,單個檢查點即可同時支援文本到影像生成、參考圖編輯以及中英文文本渲染,無需額外的編輯骨幹網路。

LLaDA-Image-Turbo是本次釋出的亮點,它通過Twin-DMD蒸餾技術將取樣步數壓縮至2至4步,在保持影像質量的同時大幅提升推理速度,適合對延遲敏感的生產環境。Base版則採用50步取樣,面向高保真生成任務。兩個版本均提供BF16與FP8精度權重,便於不同硬體部署。

在效能上,LLaDA-Image在Qwen-Image-Bench基準上取得領先成績,英文場景綜合得分53.53,中文場景53.38,均達到當前最優(SOTA)水平。模型在自然光照、細節真實感、場景連貫性以及創意海報生成方面表現突出,同時支援指令引導的影像編輯,能忠實保留原圖內容並執行精確修改。

訓練方法上,LLaDA-Image採用僅影像預訓練來學習視覺先驗,隨後引入配對語言監督和聯合生成-編輯訓練。這種分階段策略旨在讓模型先掌握視覺結構,再學習語言對齊,從而提升生成質量與編輯一致性。官方計劃後續開源訓練程式碼,進一步兌現“完全開放訓練配方”的承諾。

此次釋出對AI影像生成領域具有多重意義。一方面,開源權重與推理程式碼降低了開發者使用先進影像模型的門檻,尤其對中文場景的文本渲染能力可能填補現有開源模型的空白。另一方面,Turbo版的低步數推理設計,有望減少對高階GPU的依賴,使即時影像生成在消費級硬體上成為可能。

從產業視角看,螞蟻集團通過百靈實驗室持續加碼AI基礎模型研發,此次影像模型的釋出與其此前在語言模型領域的佈局形成互補。開源策略也可能對閉源商業影像模型形成競爭壓力,推動行業整體降低API呼叫成本。不過,模型的實際應用效果仍需社群驗證,其訓練程式碼尚未公開,復現與二次開發存在一定限制。

對於AI應用開發者而言,LLaDA-Image-Turbo提供了快速迭代的選項,尤其適合需要批次生成或即時編輯的場景。而對於算力基礎設施提供商,高效推理模型可能改變影像生成任務的算力需求結構,從重訓練轉向重推理最佳化。