MiniMax H3 是上海稀宇科技(MiniMax)在 2026 年 7 月 31 日釋出的影片生成模型,並於北京時間 8 月 3 日 0 點開源權重(許可證文本落款的釋出/授權日期為 8 月 2 日)。官方稱它為「通用的全模態生成模型」:能同時理解文字、圖片、影片、音訊組成的多模態上下文,一次生成帶原生雙聲道音效的影片。按 Hugging Face 官方模型卡:輸出時長 4~15 秒24 FPS、音訊 32 kHz 立體聲,預設短邊 768 畫素,經 H3-Regenerate-2K 再生成可到 2K;對白穩定支援中文、英文等 11 種語言。想用它有三條路:在 hailuoai.com 海螺 AI 裡直接生成;開發者在 platform.minimax.cn 調 MiniMax-H3;或到 Hugging Face 的 MiniMaxAI/MiniMax-H3 下載權重自己部署。它是海螺影片繼 Hailuo 01、Hailuo 02 之後的新一代,產品層面的入口與域名辨析見 海螺AI網頁版 頁。

MiniMax H3 引數與架構

核心的 H3-Omni-Transformer 是 330 億引數(33B)的稠密單流 Transformer(Hugging Face 統計為 33,122,992,896 個引數),其中約 130 億引數在 AdaLN 分支裡——官方說明這部分輸出可以預先計算快取,只做推理時不必載入,社群的「pruned(裁剪版)」權重就是去掉了這塊。文本與視覺理解用的編碼器是完整的 Qwen3-VL-32B(取第 50 層隱狀態),影片 VAE 空間壓縮 16 倍、時間壓縮 4 倍,音訊 VAE 把 32 kHz 音訊壓到每秒 40 個 token。權重分成兩個任務檢查點:FL2VA(文生影片、首幀/尾幀/首尾幀生影片)和 Ref2VA(全能參考:最多 9 張圖、3 段影片、3 段音訊,合計不超過 12 個檔案),都是 BF16 精度、做過 CFG 蒸餾。

要注意開源的不是完整系統:官方的 H3 由三段組成——負責理解並改寫多模態指令的 H3-Context-IR、生成 768P 音影片的 H3-Base、把 768P 再生成為 2K 的 H3-Regenerate-2K。這次只開源了 H3-Base;Context-IR 依賴多個託管模型與服務、不開源,Regenerate-2K 官方稱「待準備好後釋出」,兩者目前都得調開放平台 API。官方特別強調 Context-IR 對最終質量「至關重要」,本地只跑 H3-Base 的,建議照官方的提示詞寫作指南自己搭一層預處理。稀疏注意力推理實現也寫明會在後續更新中單獨釋出。

開源許可證:能不能商用

許可證是獨立的 MiniMax H3 Community License Agreement,授權方為 Nanonoble Pte. Ltd.,適用香港法律。要點:①地域限制——美國、歐盟、英國、韓國被列為「排除地區」,不在授權範圍內(官方說是因為這些地區影片生成監管尚不明朗,可另行申請授權),中國大陸不在排除之列;②商用——免版稅可商用,但商業產品或服務年收入超過 2,000 萬美元須事先取得 MiniMax 書面授權,且使用 H3 的商業產品須在介面顯著位置標註「MiniMax H3」;③不得用 H3 或其輸出去改進其他 AI 模型,不得用於軍事用途;④對外提供生成服務的,要建立防侵權、防濫用的稽核與舉報機制。編碼器 Qwen3-VL-32B 部分另按 Apache 2.0。

本地部署視訊記憶體:官方口徑

先說結論:MiniMax 官方沒有公佈 H3 的最低視訊記憶體。官方開放平台的《本地執行與自託管部署 MiniMax H3》文件(2026-08-26 審閱)原話是 ComfyUI 指南「未公佈」最低視訊記憶體與效能,SGLang 路徑給的 8 × B200 只是參考配置、「不代表最低硬體要求」。能查到的實測數字都來自官方推薦的推理框架文件:SGLang Cookbook 寫明 H3 完整權重約 108 GB(DiT 61.73 GB+文本編碼器 46.18 GB),「任何消費級配置都放不下全部權重」,關鍵不在顯示卡而在主機記憶體有多大——按層解除安裝方案下,12 GB 視訊記憶體+32 GB 記憶體能跑通 864×480、124 幀、20 步(每步約 16.8~18.7 秒,但該數字是在 2 TB 記憶體的機器上測得,真實 32 GB 記憶體的電腦會因反覆讀盤更慢);16 GB 視訊記憶體+約 117 GB 可鎖頁記憶體可把每步降到約 6 秒;單張 RTX 4090 D 24 GB 配合線上 INT8 量化跑 1344×768、107 幀、20 步,視訊記憶體峰值約 18 GB、端到端 303.3 秒。diffusers 文件的口徑是:BF16 下 Transformer 61.7 GB、Qwen3-VL 編碼器 62.1 GB,單張 80 GB 卡要靠自動 CPU 解除安裝,24~32 GB 消費卡需 INT8 量化加分塊解除安裝,INT8 時約佔 75 GB 主機記憶體;兩張 80 GB 卡可不解除安裝跑滿 BF16。

本地部署視訊記憶體:社群量化版

B 站、知乎上大量教程標題寫「8G 視訊記憶體就能跑」,靠的是兩件事:一是社群低位元量化權重,二是 ComfyUI 的按層解除安裝——需要哪層才搬進視訊記憶體,其餘留在記憶體和硬碟。這類說法是社群實測,不是官方要求,畫質、速度和對記憶體的依賴都要自己驗證。可以對照幾份權重的實際體積(Hugging Face 檔案大小,2026-09-14 查詢):Comfy-Org 轉換版的 FL2VA 裁剪 INT8 模型 20.97 GB、裁剪 FP8 20.96 GB,文本編碼器 NVFP4 版 15.69 GB,影片 VAE 5.21 GB、音訊 VAE 0.61 GB;unsloth 的 GGUF 版裁剪 FL2VA 從 Q2_K 6.72 GB、Q4_K 11.42 GB 到 Q8_0 21.44 GB 不等,另有 NVFP4、INT4/INT8 混合量化等社群版本。視訊記憶體越小,越依賴大記憶體兜底、出片也越慢。各檔顯示卡怎麼選見 本地部署顯示卡選型

官方推薦的部署方式

H3 模型卡列出四條路:SGLang(官方文件標註 Preview,v0.5.17 及以後版本已支援,模型卡示例用 4 卡起服務)、vLLM(官方文件註明 vLLM-Omni 方案為社群維護的 recipe)、diffusers(以 ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") 載入,按任務只拉需要的元件)、ComfyUI(0.30.0 及以上原生模板,用 Comfy-Org 轉換權重)。個人電腦想點鼠標出片選 ComfyUI;要做成 HTTP 服務、接進應用選 SGLang。下載前注意:官方倉庫同時放了原始檢查點(FL2VA/、Ref2VA/)和 diffusers 格式兩套,整個倉庫合計約 498.5 GB,用 hf download 時要加 --include 只拉需要的目錄;官方文件估計每個檢查點分割槽約佔 135 GiB 磁碟。

在海螺 AI 裡怎麼用 H3

不想部署的,直接開啟 hailuoai.com(中文站,大陸可直連),頂欄進入「影片 H3」即可生成;海外賬號走 hailuoai.video。也可以裝官方桌面端 MiniMax Design,它是多模態創作 Agent,把出圖、出片、配音串成一條流水線。國際站 H3 頁面給出的參考成本是 2K 影片每秒約 0.073~0.120 美元(隨套餐不同),並自稱比 Seedance 2.5 的 720P 低 46%~67%——這是海螺官方的自比口徑。中文站的會員檔位與積分消耗,以登入後的訂閱頁為準。

MiniMax H3 API 價格

走開放平台按量計費(人民幣刊例價,2026-09-14 核):MiniMax-H3 768P ¥0.50/秒、2K ¥0.80/秒,按輸出秒數計;輸入素材裡音訊免費,圖片 5 張以內免費、超出 ¥0.20/張,輸入影片按時長和生成解析度另計(2K ¥0.80/秒、768P ¥0.50/秒)。把 768P 成片再生成為 2K 的 MiniMax-H3-Regeneration 為 ¥0.30/秒;提示詞理解的 MiniMax-H3-Context-IR 每百萬 token 輸入 ¥5.80、輸出 ¥23.00。另有 MiniMax-H3-Max:官方文件說明它由 MiniMax 與 fal.ai 聯合出品、基於 H3 後訓練,專為高速生成最佳化,只出 480P(¥0.33/秒)和 768P(¥0.50/秒),時長 5~15 秒,未見開源權重。按官方口徑,一條 10 秒 2K 影片約 ¥8。官方釋出文稱 H3 在 2K 下每秒價格不到主流模型的三分之一。

榜單成績

釋出時多家媒體報道 H3 登上第三方評測平台 Artificial Analysis 影片編輯榜第一、是首個登頂該平台影片榜的開源模型。榜單排名會隨新模型加入變動,本站 2026-09-14 檢視 Artificial Analysis 官網的盲測 Elo:影片編輯榜第 2(1128 分,阿里 Wan 3.0 以 1196 分居首);文生影片(帶音訊)榜第 4(1226 分),是其中得分最高的開源權重模型;圖生影片(帶音訊)榜第 3(1190 分)。後訓練版 H3 Max 分別排在文生影片第 3(1231 分)和圖生影片第 1(1206 分)。

MiniMax H3 和 M3 是什麼區別

兩者經常被一起搜,但完全不是一類模型H 系列是影片生成(H3 輸出帶聲音的影片),M 系列是文本大模型MiniMax M3 於 2026 年 6 月 1 日在開放平台釋出,Hugging Face 模型卡寫明為約 4,280 億總引數、約 230 億啟用引數的原生多模態模型(能看圖、看影片,但只輸出文字),上下文 1M tokens(官網稱保障至少 512K 可用),主打程式設計與 Agent 任務,權重在 MiniMaxAI/MiniMax-M3、許可證為 MiniMax 自有的社群許可。M3 按 token 計費:≤512K 輸入檔標準刊例價每百萬 token 輸入 ¥4.20、輸出 ¥16.80,官網標註「永久五折」後為 ¥2.10/¥8.40。一句話:要生成影片找 H3,要寫程式碼、做對話和 Agent 找 M3;M3 與其他文本模型的比價見 MiniMax 模型與 API 價格。官方在 H3 釋出文裡也提到,下一代 H 系列會推動與 M 系列能力的融合。

MiniMax Code 與 MiniMax Design

這兩個也是和 H3 一起高頻出現的名字,都是 MiniMax 的產品而非模型:MiniMax Code 是官網列出的基於 M3 的通用 Agent 平台(code.minimaxi.com 現跳轉到 agent.minimaxi.com),偏程式設計與辦公任務,和影片無關;MiniMax Design 是面向商業內容生產的多模態創作 Agent 桌面應用(官網 design.minimaxi.com,下載入口 hub.minimaxi.com),H3 官方模型卡把它列為 H3 的桌面端入口,頁面上的「教程中心」也是搜尋結果裡常見的 H3 教程來源。