MiniMax 今日釋出新一代開源影片模型 MiniMax H3,主打“Seedance 級別”的全模態精準控制與“AI 原生後期”能力。實測顯示,該模型不僅能基於 7 張產品截圖生成一支宣傳片,還能在保持人物動作與鏡頭運鏡的前提下,精準替換物體、修改背景、調整鏡頭角度,甚至將小提琴換成二胡。在 Artificial Analysis 的全球影片編輯榜上,H3 釋出即超越 Gemini Omni 等模型,拿下榜單第一。

H3 是一款“開放通用多模態影片模型”,支援文字、圖片、影片和音訊混合輸入,一次最多使用 9 張圖片、3 段影片和 3 段音訊,混合檔案上限為 12 個。在測試中,編輯將 7 張產品截圖和一段設計介紹影片交給 H3,僅用一句話提示詞,模型便自動完成轉場與動效,生成兩支風格一致、文字準確的宣傳片,且一次性生成、無需抽卡。不過,當畫面中出現較小且密集的文本時,H3 仍偶發亂碼,上傳圖片的畫質會直接影響生成準確性。

H3 的精準編輯能力是其核心亮點。在 Artificial Analysis 榜單登頂後,編輯復現了 Gemini Omni 釋出時的小提琴案例:將小提琴家在音樂廳演奏的影片,直接修改為在草原和海邊的場景,人物光影、表情、鏡頭視角均完美保留,僅背景被精準替換。更進一步的測試中,H3 將小提琴換成二胡,甚至讓演奏者“彈空氣提琴”,物體替換無縫完成。在雙人畫面中,H3 還能分別處理不同物件的指令,例如將左邊人物的衣服換成參考圖樣式,同時將右邊人物變成一條狗。此外,H3 支援調整攝像機角度,同時保持人物細節與背景一致。

對於專業使用者,H3 相容分鏡工作流。編輯用 GPT Image 2 生成機車圖片和分鏡,H3 能重新佈局畫面,並將文字作為視覺設計元素融入場景,而非簡單疊加。例如,將機車名稱和 Logo 放在機車下方,更符合觀看體驗。H3 還能生成遊戲 HUD 介面、產品廣告片,並結合語音模型實現聲音、畫面與角色動作的對齊。

H3 的另一大優勢是降低使用成本。通過技術積累,MiniMax 為企業客戶和創作者提供更低的使用成本,同時解決了生成“不可控”、“離成片遠”的問題。編輯認為,H3 不僅讓非影片專業使用者能以極低門檻製作 demo 和提案素材,還顯著降低了非專業使用者與專業使用者協作時的溝通障礙。

從產業角度看,AI 影片競爭正從單純追求畫質和電影感,轉向更完整的生產工具能力。H3 將生成、剪輯、字幕、動效、聲音等環節整合進單一模型,並開源,讓內容團隊可以圍繞模型搭建自己的影片生產能力,而非依賴高價 Token 採購。這或許為 AI 影片發展開闢了另一條賽道:持續打磨模型能力,使其更接近真正可交付內容的生產工具。