7月31日,影片生成模型迎來罕見的“撞車日”:MiniMax H3與字節跳動的Seedance 2.5同日上線。前者宣佈即將開放權重,將文字、圖片、影片和音訊統一進一段可自由呼叫的上下文;後者則延續閉源工業化路線,接替上一代SOTA Seedance 2.0,主打30秒直出、更大規模素材參考和更精確的鏡頭控制。兩款模型正面交鋒,被媒體形容為“旗鼓相當,性格迥異”。
據矽星人Pro的實測,兩款模型在多項任務中各有取捨,難分高下。在導演級指令跟隨測試中,H3的電影感來自畫面本身:狐狸、霸王龍、展櫃和穹頂始終處於同一穩定空間,地面倒影基本同步,毛色體型保持一致,結尾燈光依次亮起、鏡頭拉遠升大全景,一氣呵成。但若逐條核對分鏡,H3漏掉了開場的藍鯨骨架俯衝,低機位跟拍變成背後跟隨,狐狸也未真正奔跑。Seedance 2.5則幾乎補回了所有運鏡指令:鏡頭穿過骨架、平切到狐狸側面、掠過石柱,狐狸真的奔跑起來,倒影方向正確。然而它忽略了“一鏡到底”的要求,各鏡頭拼接後不像發生在同一博物館,結尾石柱消失,骨架變成有皮有肉的真實動物。
在廣告與短劇這類商用場景中,H3保住了產品關鍵元素,舞者從罐身走出、觸發舞台、回到包裝,創意閉環完整,但精確動作和鏡頭落點有瑕疵;Seedance 2.5畫面精緻度稍遜,卻更準確地完成了二維到三維的轉化,並在結尾將鏡頭交給指定產品。媒體評價:H3更像廣告,Seedance 2.5完成得更準。
最嚴苛的測試是多機位機器人訓練資料生成。這類任務要求四路畫面逐幀同步,滿足空間、時間、接觸和相機幾何約束。實測中,H3生成的四個畫面均為同一視角,Seedance 2.5雖有視角差異,但機器人與運動均與提示詞要求關係不大。媒體指出,通用影片模型“已經很會拍戲,但距離可靠地模擬世界還有一道很厚的牆”。
在單項加試中,H3展現出對複雜細節的呈現能力。面對一段500字的東京街頭長提示詞,H3整體理解良好,人物日系風格還原到位,彈珠特寫中的“Moon 24”光斑細節超出預期,動作順序基本正確,面孔服裝保持穩定。但精確執行仍有取捨:鏡頭未真正旋轉120度,雨傘和彈珠在出租車經過後悄悄換手,櫥窗同步倒影缺失。Seedance 2.5的強項則在於30秒直出和準確的鏡頭運動,其意義不僅在於生成時長,更在於對導演指令的精確執行。
綜合來看,兩款模型代表了影片生成的兩條路線:H3追求“像什麼”,注重整體電影感與細節連貫;Seedance 2.5追求“做什麼”,強調鏡頭運動與指令執行。媒體認為,影片創作者終於有了兩個完全不同的頂級選擇。對於AI產業而言,這一對比也揭示了影片模型在創意內容與工業級應用之間的平衡難題,以及通往“世界模型”的漫長道路。