MiniMax 于 Hugging Face 平台正式发布其最新原生多模态模型 MiniMax-M3,该模型总参数量约 428B,激活参数约 23B,支持 100 万 token 的超长上下文窗口。与许多后期融合多模态能力的模型不同,M3 从训练第一步起就采用混合模态训练,旨在实现文本、图像与视频之间更深层的语义融合。

在长上下文处理效率上,M3 引入了 MiniMax 稀疏注意力机制。相比传统分组查询注意力,该机制大幅降低了注意力计算量与内存占用,同时保持模型质量。官方数据显示,在处理百万 token 上下文时,M3 的预填充速度是前代 M2 的 9 倍,解码速度提升 15 倍,单 token 计算量降至 M2 的 1/20。这一效率提升对于需要处理超长文档、多轮对话或复杂视频理解的场景尤为关键。

在能力维度上,M3 在长程智能体基准测试中达到前沿水平,尤其在编码与协作任务上表现突出。模型支持通过 `thinking` 参数控制三种推理模式:始终启用推理、自适应判断是否需要推理、禁用推理以最小化延迟。MiniMax 建议使用 `temperature=1.0`、`top_p=0.95` 的参数组合以获得最佳性能。

M3 采用 MiniMax 社区许可协议,已在 Hugging Face 开放权重下载。官方推荐使用 SGLang、vLLM、Transformers、KTransformers、unsloth 或 ATOM 等推理框架进行本地部署。技术报告已同步发布在 arXiv(编号 2606.13392)。

作为中国 AI 模型层的重要参与者,MiniMax 此前已推出多款模型。M3 的发布进一步丰富了其产品矩阵,尤其在长上下文与多模态融合方向形成差异化竞争力。对于 AI 应用开发者而言,M3 的百万 token 上下文与稀疏注意力架构,可能降低长序列推理的算力成本,从而推动更多复杂智能体应用落地。