MiniMax H3 是上海稀宇科技(MiniMax)在 2026 年 7 月 31 日发布的视频生成模型,并于北京时间 8 月 3 日 0 点开源权重(许可证文本落款的发布/授权日期为 8 月 2 日)。官方称它为「通用的全模态生成模型」:能同时理解文字、图片、视频、音频组成的多模态上下文,一次生成带原生双声道音效的视频。按 Hugging Face 官方模型卡:输出时长 4~15 秒、24 FPS、音频 32 kHz 立体声,默认短边 768 像素,经 H3-Regenerate-2K 再生成可到 2K;对白稳定支持中文、英文等 11 种语言。想用它有三条路:在 hailuoai.com 海螺 AI 里直接生成;开发者在 platform.minimax.cn 调 MiniMax-H3;或到 Hugging Face 的 MiniMaxAI/MiniMax-H3 下载权重自己部署。它是海螺视频继 Hailuo 01、Hailuo 02 之后的新一代,产品层面的入口与域名辨析见 海螺AI网页版 页。
MiniMax H3 参数与架构
核心的 H3-Omni-Transformer 是 330 亿参数(33B)的稠密单流 Transformer(Hugging Face 统计为 33,122,992,896 个参数),其中约 130 亿参数在 AdaLN 分支里——官方说明这部分输出可以预先计算缓存,只做推理时不必加载,社区的「pruned(裁剪版)」权重就是去掉了这块。文本与视觉理解用的编码器是完整的 Qwen3-VL-32B(取第 50 层隐状态),视频 VAE 空间压缩 16 倍、时间压缩 4 倍,音频 VAE 把 32 kHz 音频压到每秒 40 个 token。权重分成两个任务检查点:FL2VA(文生视频、首帧/尾帧/首尾帧生视频)和 Ref2VA(全能参考:最多 9 张图、3 段视频、3 段音频,合计不超过 12 个文件),都是 BF16 精度、做过 CFG 蒸馏。
要注意开源的不是完整系统:官方的 H3 由三段组成——负责理解并改写多模态指令的 H3-Context-IR、生成 768P 音视频的 H3-Base、把 768P 再生成为 2K 的 H3-Regenerate-2K。这次只开源了 H3-Base;Context-IR 依赖多个托管模型与服务、不开源,Regenerate-2K 官方称「待准备好后发布」,两者目前都得调开放平台 API。官方特别强调 Context-IR 对最终质量「至关重要」,本地只跑 H3-Base 的,建议照官方的提示词写作指南自己搭一层预处理。稀疏注意力推理实现也写明会在后续更新中单独发布。
开源许可证:能不能商用
许可证是独立的 MiniMax H3 Community License Agreement,授权方为 Nanonoble Pte. Ltd.,适用香港法律。要点:①地域限制——美国、欧盟、英国、韩国被列为「排除地区」,不在授权范围内(官方说是因为这些地区视频生成监管尚不明朗,可另行申请授权),中国大陆不在排除之列;②商用——免版税可商用,但商业产品或服务年收入超过 2,000 万美元须事先取得 MiniMax 书面授权,且使用 H3 的商业产品须在界面显著位置标注「MiniMax H3」;③不得用 H3 或其输出去改进其他 AI 模型,不得用于军事用途;④对外提供生成服务的,要建立防侵权、防滥用的审核与举报机制。编码器 Qwen3-VL-32B 部分另按 Apache 2.0。
本地部署显存:官方口径
先说结论:MiniMax 官方没有公布 H3 的最低显存。官方开放平台的《本地运行与自托管部署 MiniMax H3》文档(2026-08-26 审阅)原话是 ComfyUI 指南「未公布」最低显存与性能,SGLang 路径给的 8 × B200 只是参考配置、「不代表最低硬件要求」。能查到的实测数字都来自官方推荐的推理框架文档:SGLang Cookbook 写明 H3 完整权重约 108 GB(DiT 61.73 GB+文本编码器 46.18 GB),「任何消费级配置都放不下全部权重」,关键不在显卡而在主机内存有多大——按层卸载方案下,12 GB 显存+32 GB 内存能跑通 864×480、124 帧、20 步(每步约 16.8~18.7 秒,但该数字是在 2 TB 内存的机器上测得,真实 32 GB 内存的电脑会因反复读盘更慢);16 GB 显存+约 117 GB 可锁页内存可把每步降到约 6 秒;单张 RTX 4090 D 24 GB 配合在线 INT8 量化跑 1344×768、107 帧、20 步,显存峰值约 18 GB、端到端 303.3 秒。diffusers 文档的口径是:BF16 下 Transformer 61.7 GB、Qwen3-VL 编码器 62.1 GB,单张 80 GB 卡要靠自动 CPU 卸载,24~32 GB 消费卡需 INT8 量化加分块卸载,INT8 时约占 75 GB 主机内存;两张 80 GB 卡可不卸载跑满 BF16。
本地部署显存:社区量化版
B 站、知乎上大量教程标题写「8G 显存就能跑」,靠的是两件事:一是社区低比特量化权重,二是 ComfyUI 的按层卸载——需要哪层才搬进显存,其余留在内存和硬盘。这类说法是社区实测,不是官方要求,画质、速度和对内存的依赖都要自己验证。可以对照几份权重的实际体积(Hugging Face 文件大小,2026-09-14 查询):Comfy-Org 转换版的 FL2VA 裁剪 INT8 模型 20.97 GB、裁剪 FP8 20.96 GB,文本编码器 NVFP4 版 15.69 GB,视频 VAE 5.21 GB、音频 VAE 0.61 GB;unsloth 的 GGUF 版裁剪 FL2VA 从 Q2_K 6.72 GB、Q4_K 11.42 GB 到 Q8_0 21.44 GB 不等,另有 NVFP4、INT4/INT8 混合量化等社区版本。显存越小,越依赖大内存兜底、出片也越慢。各档显卡怎么选见 本地部署显卡选型。
官方推荐的部署方式
H3 模型卡列出四条路:SGLang(官方文档标注 Preview,v0.5.17 及以后版本已支持,模型卡示例用 4 卡起服务)、vLLM(官方文档注明 vLLM-Omni 方案为社区维护的 recipe)、diffusers(以 ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") 加载,按任务只拉需要的组件)、ComfyUI(0.30.0 及以上原生模板,用 Comfy-Org 转换权重)。个人电脑想点鼠标出片选 ComfyUI;要做成 HTTP 服务、接进应用选 SGLang。下载前注意:官方仓库同时放了原始检查点(FL2VA/、Ref2VA/)和 diffusers 格式两套,整个仓库合计约 498.5 GB,用 hf download 时要加 --include 只拉需要的目录;官方文档估计每个检查点分区约占 135 GiB 磁盘。
在海螺 AI 里怎么用 H3
不想部署的,直接打开 hailuoai.com(中文站,大陆可直连),顶栏进入「视频 H3」即可生成;海外账号走 hailuoai.video。也可以装官方桌面端 MiniMax Design,它是多模态创作 Agent,把出图、出片、配音串成一条流水线。国际站 H3 页面给出的参考成本是 2K 视频每秒约 0.073~0.120 美元(随套餐不同),并自称比 Seedance 2.5 的 720P 低 46%~67%——这是海螺官方的自比口径。中文站的会员档位与积分消耗,以登录后的订阅页为准。
MiniMax H3 API 价格
走开放平台按量计费(人民币刊例价,2026-09-14 核):MiniMax-H3 768P ¥0.50/秒、2K ¥0.80/秒,按输出秒数计;输入素材里音频免费,图片 5 张以内免费、超出 ¥0.20/张,输入视频按时长和生成分辨率另计(2K ¥0.80/秒、768P ¥0.50/秒)。把 768P 成片再生成为 2K 的 MiniMax-H3-Regeneration 为 ¥0.30/秒;提示词理解的 MiniMax-H3-Context-IR 每百万 token 输入 ¥5.80、输出 ¥23.00。另有 MiniMax-H3-Max:官方文档说明它由 MiniMax 与 fal.ai 联合出品、基于 H3 后训练,专为高速生成优化,只出 480P(¥0.33/秒)和 768P(¥0.50/秒),时长 5~15 秒,未见开源权重。按官方口径,一条 10 秒 2K 视频约 ¥8。官方发布文称 H3 在 2K 下每秒价格不到主流模型的三分之一。
榜单成绩
发布时多家媒体报道 H3 登上第三方评测平台 Artificial Analysis 视频编辑榜第一、是首个登顶该平台视频榜的开源模型。榜单排名会随新模型加入变动,本站 2026-09-14 查看 Artificial Analysis 官网的盲测 Elo:视频编辑榜第 2(1128 分,阿里 Wan 3.0 以 1196 分居首);文生视频(带音频)榜第 4(1226 分),是其中得分最高的开源权重模型;图生视频(带音频)榜第 3(1190 分)。后训练版 H3 Max 分别排在文生视频第 3(1231 分)和图生视频第 1(1206 分)。
MiniMax H3 和 M3 是什么区别
两者经常被一起搜,但完全不是一类模型:H 系列是视频生成(H3 输出带声音的视频),M 系列是文本大模型。MiniMax M3 于 2026 年 6 月 1 日在开放平台发布,Hugging Face 模型卡写明为约 4,280 亿总参数、约 230 亿激活参数的原生多模态模型(能看图、看视频,但只输出文字),上下文 1M tokens(官网称保障至少 512K 可用),主打编程与 Agent 任务,权重在 MiniMaxAI/MiniMax-M3、许可证为 MiniMax 自有的社区许可。M3 按 token 计费:≤512K 输入档标准刊例价每百万 token 输入 ¥4.20、输出 ¥16.80,官网标注「永久五折」后为 ¥2.10/¥8.40。一句话:要生成视频找 H3,要写代码、做对话和 Agent 找 M3;M3 与其他文本模型的比价见 MiniMax 模型与 API 价格。官方在 H3 发布文里也提到,下一代 H 系列会推动与 M 系列能力的融合。
MiniMax Code 与 MiniMax Design
这两个也是和 H3 一起高频出现的名字,都是 MiniMax 的产品而非模型:MiniMax Code 是官网列出的基于 M3 的通用 Agent 平台(code.minimaxi.com 现跳转到 agent.minimaxi.com),偏编程与办公任务,和视频无关;MiniMax Design 是面向商业内容生产的多模态创作 Agent 桌面应用(官网 design.minimaxi.com,下载入口 hub.minimaxi.com),H3 官方模型卡把它列为 H3 的桌面端入口,页面上的「教程中心」也是搜索结果里常见的 H3 教程来源。