8月6日,阿里巴巴影片生成大模型Wan 3.0正式開啟公測,在生成時長、創作方式、參考能力及真實世界還原等維度全面升級。最直觀的變化是單次可生成30秒影片,相比此前版本大幅延長,讓AI影片從“生成一個鏡頭”走向“講述一段完整的故事”,連續運鏡、一鏡到底等複雜鏡頭語言得以實現。同時,模型新增智慧時長功能,可根據提示詞自動推薦合適的影片時長。

Wan3.0的另一項突破是首次支援文件格式輸入,在文本、圖片、音訊、影片四種基礎模態之外,新增對doc、xls、ppt、pdf、md等格式的支援。使用者上傳單個檔案或連結(不超過100MB、50頁),搭配提示詞即可生成教學課件、產品演示、業務彙報等內容。例如,上傳一個智慧眼鏡產品的PPT,就能得到完整的形象片。這標誌著Wan3.0正從單純的影片生成模型,躍遷為資訊的表達載體,將結構化文件轉化為視覺敘事。

在真實世界還原方面,Wan3.0力求“千人千面”,更敏銳地刻畫五官與皮膚細節,人物情緒表達自然剋制,微表情與肢體動作聯動。在全能參考任務中,角色、道具、聲音、空間關係、風格等細粒度維度均可穩定保持。同時,數字化資訊的畫面審美也同步提升,讓圖表、資料與介面內容更具質感。此外,影片編輯能力大幅增強,支援修改畫面、劇情與台詞,但聲音質感與文字準確度仍有進步空間。

即日起,Wan3.0在阿里雲百鍊、萬鏡一刻、萬相官網、千問創作PC端、IF STUDIO和堆友開啟公測,並在千問APP灰度開放。API價格按解析度區分:480P0.3元/秒720P0.6元/秒1080P1.2元/秒,API介面將於近期全量開放。

從產業視角看,Wan3.0的釋出體現了影片生成模型從內容創作工具向生產力工具的轉變。支援文件輸入意味著AI影片可直接服務於辦公、教育、營銷等場景,降低了影片製作門檻。對AI應用層企業而言,這類能力有望提升內容生產效率,並帶動對底層算力的需求。不過,模型在聲音和文字準確性上的不足,也提示當前技術仍有完善空間。