阿里通义千问团队在 Hugging Face 上开源了 Qwen-Image-2.1,这是一款把文生图生成与图像编辑统一到同一模型中的多模态产品。其视觉生成组件仅 7B 参数,由 32 层单流 DiT 构成,官方称其在生成质量、推理效率与通用性之间取得了平衡。
据模型卡介绍,此次发布围绕四项改进展开。其一是紧凑高效:采用混合粒度注意力与前缀 KV 缓存复用,在较低算力开销下维持图像质量。其二是原生透明与创作编辑统一:模型既能从文本生成普通图像,也能生成透明(RGBA)图像,还可编辑透明图层、从照片中提取主体,这些能力集中在同一个模型内完成。其三是编辑能力更灵活:最多支持 10 张参考图像,可通过圈选、涂画标注或独立掩码指定局部编辑区域,并在编辑人物与商品时保持主体一致性。其四是质感与美学优化:在排版文字、人像布光与细节呈现上有所改进。
与主模型同步发布的还有 Qwen-Image-2.1-PE-I2I,这是一个面向图像编辑的提示词改写模型。它由 Qwen3.5-VL 9B 微调而来,作用是接收一条含糊的编辑指令加上输入图像,输出一条精确、可执行的提示词,供下游图像编辑模型使用。模型卡给出的示例是,用户输入「把天空改成日落」这类简短指令,模型会将其扩写为更具体的编辑描述。
在输出格式上,该改写模型会在思考推理块之后返回一个 JSON 对象,包含三个字段:rewritten_prompt 为扩写后的编辑指令,wh_ratio 为模型选定的画幅比例(如 16:9),ratio_follow 表示沿用某张输入图像的画幅(如 image1)。后两者互斥,同一时刻只有一个字段带值。
使用层面,模型卡提供了基于 Transformers 的快速上手代码,依赖 transformers 5.4.0 及以上、torch 2.4.0 及以上,以及 accelerate 与 pillow。代码示例展示了如何加载模型自带的系统提示词、传入输入图像与用户指令、生成改写结果并解析 JSON。多图编辑场景下,模型支持以 image1、image2 等指代多张输入图像,例如把 image1 的主体放入 image2 的场景中。改写结果还可接入 Diffusers 的 QwenImage21Pipeline,直接驱动 Qwen-Image-2.1 完成实际编辑。
许可方面,该模型采用 Qwen 研究许可协议(Qwen Research License Agreement),并非完全开放的标准开源许可,使用前需留意其条款限制。
从产业视角看,图像生成与编辑赛道近两年竞争激烈,闭源商业模型与开源模型交替迭代。通义此次把生成与编辑合并进单一模型,并额外提供一个专门做提示词改写的中间层模型,思路是把「用户意图模糊」这一实际痛点交给模型自己解决,从而降低下游编辑工具的使用门槛。对应用层开发者而言,这类开源组件的价值在于可以本地部署、按需微调,而不必完全依赖闭源 API;对模型层竞争而言,7B 级别的视觉生成组件也意味着推理成本相对可控,有利于在消费级或边缘场景落地。不过研究许可协议的限制,可能会影响部分商业场景的直接采用,实际生态影响仍取决于后续社区适配与工具链完善程度。