阿里千问于7月21日发布第三代图像生成模型Qwen-Image-3.0,核心升级在于将图像生成从创意工具推向专业生产力工具。该模型支持最大4.5k token输入,能够精准生成报纸、分镜、试卷等包含海量文字的复杂版面,并实现10px小字的清晰渲染,同时逼真还原毛孔与发丝等微观质感。在多语言能力上,模型原生支持12种语言渲染,结合丰富的世界知识,可轻松构建网页、游戏及直播界面仿真。文生图机器评测显示,目前Qwen-Image-3.0是GPT Image 2之下国内排名第一的模型。
在实测中,Qwen-Image-3.0在文字对齐、画面细节还原、多图叙事一致性、复杂构图渲染等核心维度实现大幅升级。例如,它能根据提示词生成包含演唱会主题、日期、地址的定制门票,文字风格统一且与背景元素协调;还能将演唱会实拍图一键优化,让歌词悬浮在舞台上空或环绕应援棒,自动匹配灯光与舞台视觉,且支持中、英、韩等多语种文字精准渲染,无缺字、乱码或错位变形。
模型在长文本与多格复合排版方面表现突出。它能一次直出20个分镜的竖版短篇条漫,剧情衔接流畅,对话气泡中文字清晰通顺,人物与场景氛围统一;还能书写近800字的《滕王阁序》,模拟语文课本样式,文字无错字漏字,标题、作者与正文字体层级分明,并还原了红色篆刻印章与印刷文字质感。在复杂艺术展海报生成中,Qwen-Image-3.0能融合水彩画与赛博朋克两种风格,通过中间人物和雨雾过渡,中韩双语文字排版准确。
面对多层UI嵌套等复杂指令,模型也能准确理解并生成VSCode编程界面、千问App界面、社交媒体聊天界面和咖啡海报等多层界面,各层级布局与文字内容清晰锐利。在群像画面生成中,它能容纳二十多位人物,古装、仙侠、轻赛博朋克等多种风格角色共存,商铺招牌文字准确通顺。此外,模型还能复刻企业办公软件工作台布局,清晰划分状态栏、功能入口、数据统计卡片等六大分区,并生成包含化学式、分子结构的叶绿体光合作用原理结构图,可用于课堂科普。
当前AI生图领域正从个体创意工具向专业内容生产支撑转型。Qwen-Image-3.0的发布体现了三大趋势:图文对齐精度大幅提升、图像生成精准度持续迭代、支持批量产出商业素材与概念草图。该模型在画面生成质量与推理生成速度上相较前代产品明显提升,仅在极小部分复杂文字渲染场景存在细微瑕疵,整体已能适配绝大多数商用内容生产需求。目前,阿里云百炼、千问AI平台已开通API邀测,Qwen Studio和千问APP也即将上线供免费体验。