MiniMax 於 Hugging Face 平台正式釋出其最新原生多模態模型 MiniMax-M3,該模型總引數量約 428B,啟用引數約 23B,支援 100 萬 token 的超長上下文視窗。與許多後期融合多模態能力的模型不同,M3 從訓練第一步起就採用混合模態訓練,旨在實現文本、影像與影片之間更深層的語義融合。

在長上下文處理效率上,M3 引入了 MiniMax 稀疏注意力機制。相比傳統分組查詢注意力,該機制大幅降低了注意力計算量與記憶體佔用,同時保持模型質量。官方資料顯示,在處理百萬 token 上下文時,M3 的預填充速度是前代 M2 的 9 倍,解碼速度提升 15 倍,單 token 計算量降至 M2 的 1/20。這一效率提升對於需要處理超長文件、多輪對話或複雜影片理解的場景尤為關鍵。

在能力維度上,M3 在長程智慧體基準測試中達到前沿水平,尤其在編碼與協作任務上表現突出。模型支援通過 `thinking` 引數控制三種推理模式:始終啟用推理、自適應判斷是否需要推理、停用推理以最小化延遲。MiniMax 建議使用 `temperature=1.0`、`top_p=0.95` 的引數組合以獲得最佳效能。

M3 採用 MiniMax 社群許可協議,已在 Hugging Face 開放權重下載。官方推薦使用 SGLang、vLLM、Transformers、KTransformers、unsloth 或 ATOM 等推理框架進行本地部署。技術報告已同步釋出在 arXiv(編號 2606.13392)。

作為中國 AI 模型層的重要參與者,MiniMax 此前已推出多款模型。M3 的釋出進一步豐富了其產品矩陣,尤其在長上下文與多模態融合方向形成差異化競爭力。對於 AI 應用開發者而言,M3 的百萬 token 上下文與稀疏注意力架構,可能降低長序列推理的算力成本,從而推動更多複雜智慧體應用落地。