Mistral 在 Hugging Face 上釋出了 Mistral-Large-3-675B-Instruct-2512-NVFP4,這是其大型模型家族中 Mistral Large 3 指令版本的後訓練啟用量化權重。該模型總引數 675B、啟用引數 41B,屬於細粒度混合專家(MoE)架構,並配有 2.5B 的視覺編碼器,從零開始使用 3000 塊 H200 訓練。此次上線的 NVFP4 版本由 llm-compressor 工具生成,是 Mistral 與 vLLMRed Hat 團隊合作的成果。

從部署角度看,這次量化最直接的意義是硬體門檻的下降。官方說明,Mistral Large 3 的 FP8 版本需要單節點 B200H200 才能執行,而 NVFP4 版本可以在單節點 H100A100 上部署。對於仍以 H100、A100 為主力算力的企業而言,這等於把一款前沿級開源模型的本地部署路徑打通了。不過官方也提示,NVFP4 在 64k 以上長上下文場景會出現效能下滑,此時建議改用 FP8 權重;在 B200 上則能觀察到明顯加速,視覺資料集上有輕微回退,可能與校準主要基於文本資料有關。

模型能力方面,Mistral Large 3 Instruct 支援影像理解、數十種語言(含中文、英文、法文、西班牙文、德文、義大利文、葡萄牙文、荷蘭文、日文、韓文、阿拉伯文等)、系統提示詞遵循、原生函式呼叫與 JSON 輸出,上下文視窗256k,採用 Apache 2.0 開源許可,允許商用與非商用場景下的使用和修改。官方列出的典型用途包括長文件理解、日常 AI 助手、智慧體與工具呼叫、企業知識工作以及通用程式設計輔助。

官方同時給出了部署建議:採用客戶端—伺服器配置,系統提示詞需明確環境與用例並說明如何呼叫工具;生產環境取樣溫度建議低於 0.1;工具集合應保持精簡,避免數量過多拖累模型;啟用視覺能力時,圖片寬高比儘量接近 1:1,過窄或過寬的圖片應先裁剪。使用上推薦搭配 vLLM 0.12.0 及以上版本,並會自動安裝 mistral_common 1.8.6。對於沒有 B200 的使用者,vLLM 提供回退到 Marlin FP4 的選項,可在 A100、H100 上執行量化模型,雖無速度提升,但仍能獲得視訊記憶體收益。

官方也坦承了局限:該模型並非專用推理模型,在嚴格推理任務上可能不敵專門的推理模型;在多模態任務上落後於視覺優先的模型;且由於體量與架構原因,在資源受限或大規模場景下高效部署存在挑戰。此外,官方提醒在 32k token 以內的任務上,NVFP4 版本相比原版指令模型應無明顯效能退化,超出該長度則可能出現小幅下降。

對關注 AI 產業的讀者來說,這條釋出的關鍵詞是「量化」與「部署門檻」。675B 級 MoE 模型被壓縮到單節點 H100/A100 可跑,意味著前沿開源權重對存量算力的適配性在增強,企業本地化部署的硬體選型與推理成本結構可能隨之調整;同時,與 vLLM、Red Hat 的協作也顯示開源推理棧與模型廠商之間的協同正在加深。