面壁智能(OpenBMB)于今日发布MiniCPM5系列的首个模型MiniCPM5-1B,这是一款1B参数的稠密Transformer模型,专为端侧部署、本地运行和资源受限场景设计。据官方介绍,在与同尺寸级别的多个强开源模型对比中,MiniCPM5-1B达到了1B级开源模型的SOTA(最优水平),其优势在智能体工具调用、代码生成和困难推理任务上尤为突出。

MiniCPM5-1B的架构采用标准的LlamaForCausalLM,参数量为1,080,632,832(其中非嵌入参数约6.8亿),共24层,使用GQA注意力机制(16个查询头,2个键值头),支持131,072(约13.1万)token的上下文长度。模型提供Think/No Think两种聊天模式,通过`enable_thinking`开关切换,同一检查点既能作为快速助手,也能作为深思熟虑的推理器。

在训练方法上,MiniCPM5-1B体现了面壁智能的UltraData分层数据管理理念,分为基础训练、中期训练和后训练三个阶段。基础训练阶段通过稳定训练和衰减训练构建核心语言能力;中期训练则强化目标能力并适应目标数据分布。训练语料随模型一同发布,包括Ultra-FineWebUltra-FineWeb-L3UltraData-Math。后训练阶段采用三步走:先使用200B tokens的深度思考SFT和200B tokens的混合思考SFT建立相应能力(SFT数据发布为UltraData-SFT-2605),然后训练数学、代码、闭卷问答、写作等领域的专用RL教师模型,最后通过On-Policy Distillation(OPD)将这些教师模型的知识蒸馏回一个发布模型。

官方数据显示,RL+OPD后训练在数学、代码和指令遵循任务上带来了显著提升:平均分提升16点,同时达到最大token预算的回复占比下降29个百分点。推理RL基于DAPO-Math-17k(受JustRL极简配方启发),采用两阶段长度调度以减少超长回复;OPD则借鉴Thinking Machines Lab的On-Policy Distillation,并整合了Rethinking On-Policy Distillation的改进,使用反向KL散度作为优势估计,在每步取学生和教师模型top-k logits的并集计算反向KL,兼顾信号准确性与训练效率。

为方便部署与微调,面壁智能在GitHub仓库提供了针对主流推理后端和微调框架的单页教程及Agent Skills。模型提供多种格式:BF16最终版(含RL+OPD)、BF16 SFT-only版本、BF16 Base版本、GGUF版本(适用于llama.cpp/Ollama/LM Studio)以及MLX/4bit版本(适用于Apple Silicon)。此外,官方还推出了一款由MiniCPM5-1B驱动的本地LLM桌面宠物(Desktop Pet),进一步展示了模型的端侧应用潜力。

在评测对比中,MiniCPM5-1B与同尺寸的LFM2.5-1.2B-ThinkingQwen3-0.6B/thinkQwen3.5-0.8B/think等模型进行比较,官方称在该对比集内达到SOTA,尤其适合本地编码代理、工具助手和推理助手等场景。

MiniCPM5-1B的发布,反映了当前AI模型小型化、端侧化的重要趋势。对于AI产业投资者而言,这一进展意味着在算力成本高企的背景下,小参数模型通过精细的数据管理与创新的后训练技术,也能在特定任务上逼近甚至超越更大规模模型的表现,这可能推动边缘AI、端侧推理和隐私敏感型应用的发展,并影响相关芯片、基础设施及模型层的投资叙事。