Mistral AI 于 10 月 6 日发布 Mistral Large 4 的公开预览版,官方昵称“le Chonk”。这是该公司迄今规模最大、能力最强的模型,总参数达 1 万亿,激活参数 490 亿,原生支持多模态,覆盖编程、智能体工作流与多模态理解。用户即日起可在 Mistral Studio 试用预览 API,模型权重计划于本月底开放。

Mistral 称,ML4 在开源权重模型中性能领先,并显著优于任何在美国或欧洲开发的开源权重模型。在网络安全、金融、法律等关键企业负载上,它被描述为开源模型中的最优水平;在视觉定位等部分领域,甚至超过前沿闭源模型。

训练与部署方面,ML4 在 Mistral 位于欧洲的自有数据中心、由 3800 块英伟达 Grace Blackwell GPU 从零训练,公开预览也运行在同一套基础设施上。Mistral 强调这是其长期基础设施、研究与产品投资的重要里程碑,并以“欧洲锻造、为 AI 主权而生”定位该模型。

在正式开放权重前,Mistral 正与网络安全机构、经审核的合作伙伴及国家主管部门进行真实环境红队测试,这些方将获得审核更宽松、网络能力扩展的同一模型版本。

网络安全是本次发布重点。Mistral 称 ML4 是全球最强的网络安全 AI 模型之一:在独立评估 AI 模型发现与修复软件安全漏洞的 Artificial Analysis Cyber Index 上,它位列全球前五,并大幅领先中国以外开发的开源权重模型。在该指数一项要求模型复现并修补开源软件真实漏洞的测试中,ML4 得分 82%,为所有模型最高;在取自安全竞赛的 40 项挑战集 Cybench 中,它解决了 93% 的题目,是开源权重模型中的最高分之一。Mistral 指出,包括 Claude Opus 5.5 和 GPT-6 Astra 在内的多款领先闭源模型在同一测试中得分接近零,原因是它们拒绝执行任务——而防御软件往往需要先证明漏洞真实存在,闭源模型的安全过滤可能阻碍这类工作。

编程与智能体方面,ML4 在 DeepSWE v1.1 得分 61.7%,SWE-Atlas-QnA 得分 59.4%,Terminal-Bench 4 得分 28.3%,综合编程智能体指数得分 49.8%,领先 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。Mistral 还与 Surge AI 开展了编程质量的盲测人工评估。

训练数据上,ML4 使用了大量多语言语料,覆盖 160 多种语言,包括欧盟所有官方语言。Mistral 表示,该模型采用与客户通过 Mistral Forge 获得的相同训练、定制与强化学习环境,并已与金融、工程、制造、物流、制药、科学、航运及公共部门等关键行业企业合作训练。

Mistral 称后续将公布模型架构、更多基准与后训练方法等细节,ML4 也将成为新一代专用与优化模型的基础。模型将在全球多个区域提供,包括 Mistral 端到端运营、独立于其他数字服务商并受欧洲法律管辖的欧洲部署。