Mistral AI 于今日在 Hugging Face 上发布了 Mistral Small 4 的量化版本 Mistral-Small-4-119B-2603-NVFP4。该模型基于 119B 参数的混合专家(MoE)架构,每个 token 仅激活 6.5B 参数,支持 256k 上下文长度,并采用 Apache 2.0 开源许可,允许商业与非商业使用。
Mistral Small 4 被定位为一款强大的混合模型,既能作为通用指令模型,也能作为推理模型。它统一了 Instruct、Reasoning(前称 Magistral)和 Devstral 三个模型家族的能力,并支持多模态输入(文本与图像),输出为文本。模型提供可配置的推理模式(reasoning effort),用户可根据任务复杂度在快速回复与深度推理之间切换。
此次发布的 NVFP4 版本是 Mistral Small 4 的后训练激活量化版,由 vLLM 与 Red Hat 团队合作,使用 llm-compressor 工具创建。Mistral 特别感谢了 NVIDIA 在 SGLang 与 vLLM 内核优化方面的贡献。量化版本旨在降低部署门槛,同时保持模型性能。
在性能方面,Mistral 官方数据显示,与上一代 Mistral Small 3 相比,在延迟优化设置下,Mistral Small 4 的端到端完成时间减少了 40%;在吞吐优化设置下,每秒处理的请求数提升了 3 倍。这些数据表明,该模型在推理效率和并发处理能力上均有显著改进。
模型架构上,Mistral Small 4 采用 128 个专家、每次激活 4 个的 MoE 设计,总参数量 119B,但每个 token 仅激活 6.5B 参数,这种稀疏激活机制有助于降低推理成本。模型支持多语言,涵盖英语、法语、西班牙语、德语、中文、日语、韩语、阿拉伯语等数十种语言,并具备强大的系统提示遵循能力和原生的函数调用与 JSON 输出支持,适用于智能体(agentic)任务。
Mistral 推荐使用 vLLM 库进行生产级推理,并提供了详细的部署示例,包括通过 vLLM 服务器调用模型、进行指令遵循测试以及工具调用(如 Python 计算器)等。模型还支持通过 SGLang 进行推理,并提供了 Docker 镜像便于快速部署。
该模型的发布对 AI 产业具有多重意义。首先,作为开源模型,其 Apache 2.0 许可允许开发者自由定制和微调,降低了企业采用门槛。其次,量化版本与 vLLM 的深度集成,展示了开源社区在推理优化方面的协作成果,可能推动更多模型采用类似的高效部署方案。对于依赖大规模语言模型的应用开发者而言,119B 参数但仅激活 6.5B 的设计,意味着在保持较高智能水平的同时,可有效控制推理成本,尤其适合需要处理长上下文(如文档分析、代码库探索)的场景。
此外,Mistral Small 4 的多模态能力(图像输入)和可切换的推理模式,使其在通用聊天助手、编码智能体、研究辅助等场景中具有广泛适用性。其与 vLLM、SGLang 等主流推理框架的兼容性,也意味着开发者可以无缝集成到现有技术栈中。
从产业格局看,Mistral 持续推出高性能开源模型,与 Meta 的 Llama 系列、阿联酋的 Falcon 等形成竞争,推动开源模型生态的繁荣。此次量化版本的发布,进一步降低了部署成本,可能吸引更多中小型企业和开发者采用,从而影响模型即服务(MaaS)市场的竞争态势。不过,模型的实际性能仍需在真实场景中验证,其与闭源模型的差距也需持续观察。