7月31日,视频生成模型迎来罕见的“撞车日”:MiniMax H3与字节跳动的Seedance 2.5同日上线。前者宣布即将开放权重,将文字、图片、视频和音频统一进一段可自由调用的上下文;后者则延续闭源工业化路线,接替上一代SOTA Seedance 2.0,主打30秒直出、更大规模素材参考和更精确的镜头控制。两款模型正面交锋,被媒体形容为“旗鼓相当,性格迥异”。
据硅星人Pro的实测,两款模型在多项任务中各有取舍,难分高下。在导演级指令跟随测试中,H3的电影感来自画面本身:狐狸、霸王龙、展柜和穹顶始终处于同一稳定空间,地面倒影基本同步,毛色体型保持一致,结尾灯光依次亮起、镜头拉远升大全景,一气呵成。但若逐条核对分镜,H3漏掉了开场的蓝鲸骨架俯冲,低机位跟拍变成背后跟随,狐狸也未真正奔跑。Seedance 2.5则几乎补回了所有运镜指令:镜头穿过骨架、平切到狐狸侧面、掠过石柱,狐狸真的奔跑起来,倒影方向正确。然而它忽略了“一镜到底”的要求,各镜头拼接后不像发生在同一博物馆,结尾石柱消失,骨架变成有皮有肉的真实动物。
在广告与短剧这类商用场景中,H3保住了产品关键元素,舞者从罐身走出、触发舞台、回到包装,创意闭环完整,但精确动作和镜头落点有瑕疵;Seedance 2.5画面精致度稍逊,却更准确地完成了二维到三维的转化,并在结尾将镜头交给指定产品。媒体评价:H3更像广告,Seedance 2.5完成得更准。
最严苛的测试是多机位机器人训练数据生成。这类任务要求四路画面逐帧同步,满足空间、时间、接触和相机几何约束。实测中,H3生成的四个画面均为同一视角,Seedance 2.5虽有视角差异,但机器人与运动均与提示词要求关系不大。媒体指出,通用视频模型“已经很会拍戏,但距离可靠地模拟世界还有一道很厚的墙”。
在单项加试中,H3展现出对复杂细节的呈现能力。面对一段500字的东京街头长提示词,H3整体理解良好,人物日系风格还原到位,弹珠特写中的“Moon 24”光斑细节超出预期,动作顺序基本正确,面孔服装保持稳定。但精确执行仍有取舍:镜头未真正旋转120度,雨伞和弹珠在出租车经过后悄悄换手,橱窗同步倒影缺失。Seedance 2.5的强项则在于30秒直出和准确的镜头运动,其意义不仅在于生成时长,更在于对导演指令的精确执行。
综合来看,两款模型代表了视频生成的两条路线:H3追求“像什么”,注重整体电影感与细节连贯;Seedance 2.5追求“做什么”,强调镜头运动与指令执行。媒体认为,视频创作者终于有了两个完全不同的顶级选择。对于AI产业而言,这一对比也揭示了视频模型在创意内容与工业级应用之间的平衡难题,以及通往“世界模型”的漫长道路。