Mistral AI 於今日在 Hugging Face 上釋出了 Mistral Small 4 的量化版本 Mistral-Small-4-119B-2603-NVFP4。該模型基於 119B 引數的混合專家(MoE)架構,每個 token 僅啟用 6.5B 引數,支援 256k 上下文長度,並採用 Apache 2.0 開源許可,允許商業與非商業使用。
Mistral Small 4 被定位為一款強大的混合模型,既能作為通用指令模型,也能作為推理模型。它統一了 Instruct、Reasoning(前稱 Magistral)和 Devstral 三個模型家族的能力,並支援多模態輸入(文本與影像),輸出為文本。模型提供可配置的推理模式(reasoning effort),使用者可根據任務複雜度在快速回復與深度推理之間切換。
此次釋出的 NVFP4 版本是 Mistral Small 4 的後訓練啟用量化版,由 vLLM 與 Red Hat 團隊合作,使用 llm-compressor 工具建立。Mistral 特別感謝了 NVIDIA 在 SGLang 與 vLLM 核心最佳化方面的貢獻。量化版本旨在降低部署門檻,同時保持模型效能。
在效能方面,Mistral 官方資料顯示,與上一代 Mistral Small 3 相比,在延遲最佳化設定下,Mistral Small 4 的端到端完成時間減少了 40%;在吞吐最佳化設定下,每秒處理的請求數提升了 3 倍。這些資料表明,該模型在推理效率和併發處理能力上均有顯著改進。
模型架構上,Mistral Small 4 採用 128 個專家、每次啟用 4 個的 MoE 設計,總引數量 119B,但每個 token 僅啟用 6.5B 引數,這種稀疏啟用機制有助於降低推理成本。模型支援多語言,涵蓋英語、法語、西班牙語、德語、中文、日語、韓語、阿拉伯語等數十種語言,並具備強大的系統提示遵循能力和原生的函式呼叫與 JSON 輸出支援,適用於智慧體(agentic)任務。
Mistral 推薦使用 vLLM 庫進行生產級推理,並提供了詳細的部署示例,包括通過 vLLM 伺服器呼叫模型、進行指令遵循測試以及工具呼叫(如 Python 計算器)等。模型還支援通過 SGLang 進行推理,並提供了 Docker 映象便於快速部署。
該模型的釋出對 AI 產業具有多重意義。首先,作為開源模型,其 Apache 2.0 許可允許開發者自由定製和微調,降低了企業採用門檻。其次,量化版本與 vLLM 的深度整合,展示了開源社群在推理最佳化方面的協作成果,可能推動更多模型採用類似的高效部署方案。對於依賴大規模語言模型的應用開發者而言,119B 引數但僅啟用 6.5B 的設計,意味著在保持較高智慧水平的同時,可有效控制推理成本,尤其適合需要處理長上下文(如文件分析、程式碼庫探索)的場景。
此外,Mistral Small 4 的多模態能力(影像輸入)和可切換的推理模式,使其在通用聊天助手、編碼智慧體、研究輔助等場景中具有廣泛適用性。其與 vLLM、SGLang 等主流推理框架的相容性,也意味著開發者可以無縫整合到現有技術棧中。
從產業格局看,Mistral 持續推出高效能開源模型,與 Meta 的 Llama 系列、阿聯酋的 Falcon 等形成競爭,推動開源模型生態的繁榮。此次量化版本的釋出,進一步降低了部署成本,可能吸引更多中小型企業和開發者採用,從而影響模型即服務(MaaS)市場的競爭態勢。不過,模型的實際效能仍需在真實場景中驗證,其與閉源模型的差距也需持續觀察。