面壁智能(openbmb)在 Hugging Face 上线 MiniCPM5-2B,这是 MiniCPM5 系列继 MiniCPM5-1B 之后的第二款模型。官方将其定位为面向端侧、本地部署与资源受限场景的稠密模型,并称其在 2B 级开源模型中达到 SOTA 水平。

从模型卡信息看,MiniCPM5-2B 采用标准 LlamaForCausalLM 架构,总参数量约 25.17 亿,其中非嵌入参数约 19.82 亿;共 42 层,注意力采用 GQA,查询头 16 个、键值头 2 个;上下文长度达 131,072 token。官方列出的适用场景包括本地助手、编码智能体、工具调用工作流与推理任务。

评测方面,面壁将 MiniCPM5-2B 与同尺寸开源模型对比,包括 LFM2.5-2.6B、Qwen3.5-2B、Gemma-4-E2B-it,并列出 Qwen3.5-4B、granite-4.2-3B、Nemotron-3-Nano-4B、Gemma-4-E4B-it、LFM2.5-8B-A1B 等更大模型作参照。官方称,在该对比集合内 MiniCPM5-2B 以平均分 53.9 取得 2B 级开源 SOTA,并超过所有参比的更大模型(其中最高为 51.1);优势主要体现在代码推理、数学推理、长上下文理解、工具使用以及多项智能体任务上。模型卡中的能力雷达图还显示,Qwen3.5-4B 平均分 51.1、granite-4.2-3B 为 42.7、LFM2.5-2.6B 为 33.2。

与模型同步,面壁还开放了支撑其训练的 UltraData 系列数据集,包括高质量网页预训练数据 UltraX、采用 L0–L3 分级代码数据管理的 UltraData-Code、含 50 万智能体训练样本的 UltraData-SFT-Agent-2609,以及覆盖数学、代码、通用知识与长上下文推理的 8 万条以上高质量强化学习样本 UltraData-RL-2609。

在交付形态上,MiniCPM5-2B 提供了较完整的版本矩阵:最终版(经 RL 与 OPD 后训练)、仅 SFT 检查点、中训练检查点、纯预训练 Base 版本,以及面向 llama.cpp / Ollama / LM Studio 的 GGUF、面向苹果芯片的 MLX 4bit、GPTQ 4bit 量化版,另有用于推理加速的 DSpark 草稿模型及其 GGUF 版本,以及 LiteRT-LM 版本。MiniCPM5-1B 也提供类似的多版本分发。

从产业视角看,这条发布延续了近一年端侧小模型的竞争主线:厂商不再只比拼参数规模,而是把长上下文、工具调用与智能体能力压进 2B–4B 量级,以便在手机、PC 与边缘设备上本地运行。若这类模型的实测表现与官方榜单一致,其直接影响可能落在两处:一是端侧推理对内存与算力的需求结构,二是云端大模型 API 在轻量任务上的替代压力。不过,模型卡中的对比集合由发布方自行选定,平均分口径与具体任务权重也未在摘要中完整披露,实际能力仍需第三方基准与真实部署验证。