阿里通义千问团队开源了 Qwen-Image-2.1,这是一款把文生图与图像编辑合二为一的模型,其视觉生成组件只有 7B 参数,由 32 层单流 DiT 构成。官方称该模型在生成质量、推理效率与通用性之间取得平衡,并已在 HuggingFace、ModelScope 等平台上线,配套博客、演示与社区渠道同步开放。
官方列出四项主要改进。其一是紧凑高效:采用混合粒度注意力与前缀 KV 缓存复用,在较低算力开销下维持较强画质。其二是原生透明与统一创作编辑:模型可依据文本生成普通图像或带透明通道的 RGBA 图像,也能编辑透明图层,并从照片中提取主体,这些能力集中在同一个模型内完成。其三是编辑能力更灵活:最多可输入 10 张参考图,支持用圈选、涂鸦标注或独立蒙版指定局部修改,并在人物与商品上保持身份一致性。其四是质感与美学优化:文字排版、人像光影与细节表现均有改善。
从使用角度看,模型通过 diffusers 的 QwenImage21Pipeline 调用,安装依赖包括 torch、transformers、diffusers、accelerate 与 pillow。文生图示例以 2048×2048 分辨率、40 步推理生成霓虹招牌场景;图像编辑示例可把输入图背景替换为日落海滩;透明图生成则建议在提示词中明确说明这是带透明通道的 RGBA 图像。模型支持 1:1、4:3、3:4、3:2、2:3、16:9、9:16 等多种宽高比,最高边长可达 2752 像素,并可通过 CPU 卸载等内存优化手段降低显存占用。
对关注 AI 产业的读者而言,这条发布的意义不止于一次版本迭代。图像生成与编辑长期被拆成两条技术路线,而把二者统一进单一模型、同时把参数压到 7B 量级,意味着开发者可以用更低的部署成本覆盖从创意生成到精修编辑的完整流程。原生透明图像生成尤其值得注意——它直接对接电商素材、贴纸、UI 设计等需要图层与透明背景的实际生产场景,此前这类需求往往要借助额外工具或后处理完成。
在竞争格局上,开源图像模型近一年迭代密集,闭源商业模型则主打易用性与生态整合。Qwen-Image-2.1 以研究许可协议发布,并附带官方反馈表单,显示团队希望借助社区提示词与工作流持续改进模型。对上游算力与云服务而言,轻量模型有利于推理成本下探;对下游应用与内容平台而言,统一生成编辑能力可能加快素材生产与个性化内容的落地节奏。模型的实际表现、许可条款对商用场景的适配度,以及社区生态的跟进速度,将是后续观察重点。