阿里通義千問團隊開源了 Qwen-Image-2.1,這是一款把文生圖與影像編輯合二為一的模型,其視覺生成元件只有 7B 引數,由 32 層單流 DiT 構成。官方稱該模型在生成質量、推理效率與通用性之間取得平衡,並已在 HuggingFace、ModelScope 等平台上線,配套部落格、演示與社群渠道同步開放。
官方列出四項主要改進。其一是緊湊高效:採用混合粒度注意力與字首 KV 快取複用,在較低算力開銷下維持較強畫質。其二是原生透明與統一創作編輯:模型可依據文本生成普通影像或帶透明通道的 RGBA 影像,也能編輯透明圖層,並從照片中提取主體,這些能力集中在同一個模型內完成。其三是編輯能力更靈活:最多可輸入 10 張參考圖,支援用圈選、塗鴉標註或獨立蒙版指定區域性修改,並在人物與商品上保持身份一致性。其四是質感與美學最佳化:文字排版、人像光影與細節表現均有改善。
從使用角度看,模型通過 diffusers 的 QwenImage21Pipeline 呼叫,安裝依賴包括 torch、transformers、diffusers、accelerate 與 pillow。文生圖示例以 2048×2048 解析度、40 步推理生成霓虹招牌場景;影像編輯示例可把輸入圖背景替換為日落海灘;透明圖生成則建議在提示詞中明確說明這是帶透明通道的 RGBA 影像。模型支援 1:1、4:3、3:4、3:2、2:3、16:9、9:16 等多種寬高比,最高邊長可達 2752 畫素,並可通過 CPU 解除安裝等記憶體最佳化手段降低視訊記憶體佔用。
對關注 AI 產業的讀者而言,這條釋出的意義不止於一次版本迭代。影像生成與編輯長期被拆成兩條技術路線,而把二者統一進單一模型、同時把引數壓到 7B 量級,意味著開發者可以用更低的部署成本覆蓋從創意生成到精修編輯的完整流程。原生透明影像生成尤其值得注意——它直接對接電商素材、貼紙、UI 設計等需要圖層與透明背景的實際生產場景,此前這類需求往往要藉助額外工具或後處理完成。
在競爭格局上,開源影像模型近一年迭代密集,閉源商業模型則主打易用性與生態整合。Qwen-Image-2.1 以研究許可協議釋出,並附帶官方反饋表單,顯示團隊希望藉助社群提示詞與工作流持續改進模型。對上游算力與雲服務而言,輕量模型有利於推理成本下探;對下游應用與內容平台而言,統一生成編輯能力可能加快素材生產與個性化內容的落地節奏。模型的實際表現、許可條款對商用場景的適配度,以及社群生態的跟進速度,將是後續觀察重點。