MiniMax 正式推出其新一代原生多模態大模型 MiniMax-M3,模型卡已在 Hugging Face 平台上線。M3 是一個總引數量約 4280 億、啟用引數約 230 億混合專家(MoE)架構模型,原生支援最長 100 萬 token 的上下文視窗,能夠同時處理文本、影像和影片輸入。

此次釋出的亮點之一在於訓練範式。MiniMax 強調 M3 從訓練的第一步起就採用混合模態資料,而非在純文本基座上後期嫁接視覺模組。這種原生多模態訓練路線旨在實現文本、影像與影片之間更深層的語義融合,使模型在跨模態理解與生成任務上具備更一致的表現。

長上下文處理效率方面,M3 引入了 MiniMax 稀疏注意力機制(MiniMax Sparse Attention,簡稱 MSA)。與傳統的分組查詢注意力(GQA)相比,MSA 在百萬 token 級別大幅降低了注意力計算量和視訊記憶體佔用。根據官方技術報告,在 100 萬 token 的上下文場景下,M3 相較上一代模型 M2 取得了 9 倍的預填充(prefill)速度提升15 倍的解碼(decode)速度提升,單 token 計算量降至原來的 二十分之一。這一效率突破意味著,在超長文件分析、大規模程式碼庫理解、長影片內容處理等場景中,M3 的推理延遲和算力成本將顯著下降。

在能力定位上,M3 特別強調了 程式設計與協作智慧體(coding cowork) 方向。模型在長週期智慧體基準測試中達到前沿水平,表明其不僅具備程式碼生成能力,還能在需要多步驟規劃、工具呼叫和持續互動的複雜任務中保持穩定表現。這對於將大模型嵌入開發工作流、構建 AI 程式設計助手等應用場景具有直接價值。

為降低本地部署門檻,MiniMax 同步開源了 MXFP8 量化版本,在保持模型質量的前提下壓縮了儲存與推理資源需求。官方推薦使用 SGLangvLLMTransformers 等主流推理框架進行部署,並給出了推理引數建議:溫度設為 1.0,top_p 設為 0.95。模型權重可通過 Hugging Face 直接下載。

在 API 呼叫層面,MiniMax 為 M3 提供了三種推理模式:enabled(始終啟用推理)、adaptive(模型自動判斷是否需要額外推理)和 disabled(關閉推理以最小化延遲、最大化吞吐量)。這種靈活配置讓開發者可以根據具體任務在響應速度與推理深度之間做出權衡,有利於在不同商業場景中控制成本與使用者體驗。

從產業視角看,M3 的釋出進一步加劇了國內大模型廠商在多模態與長上下文兩條技術路線上的競爭。百萬 token 上下文視窗此前主要由海外頭部模型率先突破,M3 通過稀疏注意力機制在效率端的創新,為同等量級模型的工程落地提供了新思路。其 4280 億總引數與 230 億啟用引數的 MoE 設計,也在模型容量與推理成本之間尋求平衡——總引數規模保證了知識容量,而較低的啟用引數佔比則控制了單次推理的計算開銷。

技術報告已公開於 arXiv:2606.13392,供研究者查閱完整細節。MiniMax 方面表示,使用者可通過 model@minimax.io 聯絡團隊獲取更多技術支援。