阿里千問於7月21日釋出第三代影像生成模型Qwen-Image-3.0,核心升級在於將影像生成從創意工具推向專業生產力工具。該模型支援最大4.5k token輸入,能夠精準生成報紙、分鏡、試卷等包含海量文字的複雜版面,並實現10px小字的清晰渲染,同時逼真還原毛孔與髮絲等微觀質感。在多語言能力上,模型原生支援12種語言渲染,結合豐富的世界知識,可輕鬆構建網頁、遊戲及直播介面模擬。文生圖機器評測顯示,目前Qwen-Image-3.0是GPT Image 2之下國內排名第一的模型。
在實測中,Qwen-Image-3.0在文字對齊、畫面細節還原、多圖敘事一致性、複雜構圖渲染等核心維度實現大幅升級。例如,它能根據提示詞生成包含演唱會主題、日期、地址的定製門票,文字風格統一且與背景元素協調;還能將演唱會實拍圖一鍵最佳化,讓歌詞懸浮在舞台上空或環繞應援棒,自動匹配燈光與舞台視覺,且支援中、英、韓等多語種文字精準渲染,無缺字、亂碼或錯位變形。
模型在長文本與多格複合排版方面表現突出。它能一次直出20個分鏡的豎版短篇條漫,劇情銜接流暢,對話氣泡中文字清晰通順,人物與場景氛圍統一;還能書寫近800字的《滕王閣序》,模擬語文課本樣式,文字無錯字漏字,標題、作者與正文字型層級分明,並還原了紅色篆刻印章與印刷文字質感。在複雜藝術展海報生成中,Qwen-Image-3.0能融合水彩畫與賽博朋克兩種風格,通過中間人物和雨霧過渡,中韓雙語文字排版準確。
面對多層UI巢狀等複雜指令,模型也能準確理解並生成VSCode程式設計介面、千問App介面、社交媒體聊天介面和咖啡海報等多層介面,各層級佈局與文字內容清晰銳利。在群像畫面生成中,它能容納二十多位人物,古裝、仙俠、輕賽博朋克等多種風格角色共存,商鋪招牌文字準確通順。此外,模型還能復刻企業辦公軟體工作台佈局,清晰劃分狀態列、功能入口、資料統計卡片等六大分割槽,並生成包含化學式、分子結構的葉綠體光合作用原理結構圖,可用於課堂科普。
當前AI生圖領域正從個體創意工具向專業內容生產支撐轉型。Qwen-Image-3.0的釋出體現了三大趨勢:圖文對齊精度大幅提升、影像生成精準度持續迭代、支援批次產出商業素材與概念草圖。該模型在畫面生成質量與推理生成速度上相較前代產品明顯提升,僅在極小部分複雜文字渲染場景存在細微瑕疵,整體已能適配絕大多數商用內容生產需求。目前,阿里雲百鍊、千問AI平台已開通API邀測,Qwen Studio和千問APP也即將上線供免費體驗。