阿里通義千問團隊在 Hugging Face 上開源了 Qwen-Image-2.1,這是一款把文生圖生成與影像編輯統一到同一模型中的多模態產品。其視覺生成元件僅 7B 引數,由 32 層單流 DiT 構成,官方稱其在生成質量、推理效率與通用性之間取得了平衡。

據模型卡介紹,此次釋出圍繞四項改進展開。其一是緊湊高效:採用混合粒度注意力與字首 KV 快取複用,在較低算力開銷下維持影像質量。其二是原生透明與創作編輯統一:模型既能從文本生成普通影像,也能生成透明(RGBA)影像,還可編輯透明圖層、從照片中提取主體,這些能力集中在同一個模型內完成。其三是編輯能力更靈活:最多支援 10 張參考影像,可通過圈選、塗畫標註或獨立掩碼指定區域性編輯區域,並在編輯人物與商品時保持主體一致性。其四是質感與美學最佳化:在排版文字、人像布光與細節呈現上有所改進。

與主模型同步釋出的還有 Qwen-Image-2.1-PE-I2I,這是一個面向影像編輯的提示詞改寫模型。它由 Qwen3.5-VL 9B 微調而來,作用是接收一條含糊的編輯指令加上輸入影像,輸出一條精確、可執行的提示詞,供下游影像編輯模型使用。模型卡給出的示例是,使用者輸入「把天空改成日落」這類簡短指令,模型會將其擴寫為更具體的編輯描述。

在輸出格式上,該改寫模型會在思考推理塊之後返回一個 JSON 物件,包含三個欄位:rewritten_prompt 為擴寫後的編輯指令,wh_ratio 為模型選定的畫幅比例(如 16:9),ratio_follow 表示沿用某張輸入影像的畫幅(如 image1)。後兩者互斥,同一時刻只有一個欄位帶值。

使用層面,模型卡提供了基於 Transformers 的快速上手程式碼,依賴 transformers 5.4.0 及以上、torch 2.4.0 及以上,以及 accelerate 與 pillow。程式碼示例展示瞭如何載入模型自帶的系統提示詞、傳入輸入影像與使用者指令、生成改寫結果並解析 JSON。多圖編輯場景下,模型支援以 image1、image2 等指代多張輸入影像,例如把 image1 的主體放入 image2 的場景中。改寫結果還可接入 Diffusers 的 QwenImage21Pipeline,直接驅動 Qwen-Image-2.1 完成實際編輯。

許可方面,該模型採用 Qwen 研究許可協議(Qwen Research License Agreement),並非完全開放的標準開源許可,使用前需留意其條款限制。

從產業視角看,影像生成與編輯賽道近兩年競爭激烈,閉源商業模型與開源模型交替迭代。通義此次把生成與編輯合併進單一模型,並額外提供一個專門做提示詞改寫的中間層模型,思路是把「使用者意圖模糊」這一實際痛點交給模型自己解決,從而降低下游編輯工具的使用門檻。對應用層開發者而言,這類開源元件的價值在於可以本地部署、按需微調,而不必完全依賴閉源 API;對模型層競爭而言,7B 級別的視覺生成元件也意味著推理成本相對可控,有利於在消費級或邊緣場景落地。不過研究許可協議的限制,可能會影響部分商業場景的直接採用,實際生態影響仍取決於後續社群適配與工具鏈完善程度。