中国AI公司MiniMax于8月3日发布H3视频模型权重,使其成为首个登顶AI视频排行榜的开源模型。据Artificial Analysis榜单,H3在视频编辑类别排名第一,在文生视频中排名第二,在图生视频中排名第三。这是开源模型首次在视频生成领域取得如此成绩,标志着开源与闭源模型在视频能力上的差距正在缩小。
H3是一个拥有330亿参数的多模态模型,能够联合处理文本、图像、视频和音频,生成4至15秒的片段,并支持立体声。根据模型卡,单个提示词可包含最多九张参考图像、三个视频片段和三个音频片段,这为创作者提供了丰富的输入组合方式。MiniMax将H3的权重开源,意味着开发者可以在本地部署和微调该模型,用于定制素材、角色或特定视觉风格。
不过,H3并非完全开源。其2K分辨率模块和H3-Context-IR(将提示词和参考材料转换为结构化中间格式的组件)并未包含在开源范围内。这意味着在本地运行H3时,分辨率最高为768p,用户需要根据MiniMax发布的提示指南自行处理上下文准备。此外,开源许可对商用设有限制:仅允许年收入低于2000万美元的公司进行商业使用。这一限制可能影响大型企业直接采用,但为中小型团队和独立开发者提供了机会。
值得注意的是,在MiniMax发布H3的同一天,字节跳动也发布了其闭源模型Seedance 2.5,该模型可生成30秒的片段并内置音频。两大中国AI公司在同一天发布视频生成模型,凸显了该领域的竞争热度。Seedance 2.5的闭源策略与MiniMax的开源路线形成对比,为市场提供了不同选择。
从产业角度看,H3的开源登顶可能对视频生成工具链产生连锁反应。开源模型的性能提升,可能促使更多开发者基于H3构建应用,进而推动相关算力需求。同时,MiniMax在开源与闭源之间的平衡(保留高分辨率模块)也反映了商业考量。对于AI视频生成赛道而言,开源模型的崛起可能加速技术普及,但也可能对闭源模型的商业价值构成压力。整体来看,H3的发布是视频生成领域的一个重要里程碑,其影响有待市场进一步验证。