面壁智慧(OpenBMB)於今日釋出MiniCPM5系列的首個模型MiniCPM5-1B,這是一款1B引數的稠密Transformer模型,專為端側部署、本地執行和資源受限場景設計。據官方介紹,在與同尺寸級別的多個強開源模型對比中,MiniCPM5-1B達到了1B級開源模型的SOTA(最優水平),其優勢在智慧體工具呼叫、程式碼生成和困難推理任務上尤為突出。
MiniCPM5-1B的架構採用標準的LlamaForCausalLM,引數量為1,080,632,832(其中非嵌入引數約6.8億),共24層,使用GQA注意力機制(16個查詢頭,2個鍵值頭),支援131,072(約13.1萬)token的上下文長度。模型提供Think/No Think兩種聊天模式,通過`enable_thinking`開關切換,同一檢查點既能作為快速助手,也能作為深思熟慮的推理器。
在訓練方法上,MiniCPM5-1B體現了面壁智慧的UltraData分層資料管理理念,分為基礎訓練、中期訓練和後訓練三個階段。基礎訓練階段通過穩定訓練和衰減訓練構建核心語言能力;中期訓練則強化目標能力並適應目標資料分佈。訓練語料隨模型一同釋出,包括Ultra-FineWeb、Ultra-FineWeb-L3和UltraData-Math。後訓練階段採用三步走:先使用200B tokens的深度思考SFT和200B tokens的混合思考SFT建立相應能力(SFT資料釋出為UltraData-SFT-2605),然後訓練數學、程式碼、閉卷問答、寫作等領域的專用RL教師模型,最後通過On-Policy Distillation(OPD)將這些教師模型的知識蒸餾回一個釋出模型。
官方資料顯示,RL+OPD後訓練在數學、程式碼和指令遵循任務上帶來了顯著提升:平均分提升16點,同時達到最大token預算的回覆佔比下降29個百分點。推理RL基於DAPO-Math-17k(受JustRL極簡配方啟發),採用兩階段長度排程以減少超長回覆;OPD則借鑑Thinking Machines Lab的On-Policy Distillation,並整合了Rethinking On-Policy Distillation的改進,使用反向KL散度作為優勢估計,在每步取學生和教師模型top-k logits的並集計算反向KL,兼顧訊號準確性與訓練效率。
為方便部署與微調,面壁智慧在GitHub倉庫提供了針對主流推理後端和微調框架的單頁教程及Agent Skills。模型提供多種格式:BF16最終版(含RL+OPD)、BF16 SFT-only版本、BF16 Base版本、GGUF版本(適用於llama.cpp/Ollama/LM Studio)以及MLX/4bit版本(適用於Apple Silicon)。此外,官方還推出了一款由MiniCPM5-1B驅動的本地LLM桌面寵物(Desktop Pet),進一步展示了模型的端側應用潛力。
在評測對比中,MiniCPM5-1B與同尺寸的LFM2.5-1.2B-Thinking、Qwen3-0.6B/think和Qwen3.5-0.8B/think等模型進行比較,官方稱在該對比集內達到SOTA,尤其適合本地編碼代理、工具助手和推理助手等場景。
MiniCPM5-1B的釋出,反映了當前AI模型小型化、端側化的重要趨勢。對於AI產業投資者而言,這一進展意味著在算力成本高企的背景下,小引數模型通過精細的資料管理與創新的後訓練技術,也能在特定任務上逼近甚至超越更大規模模型的表現,這可能推動邊緣AI、端側推理和隱私敏感型應用的發展,並影響相關晶片、基礎設施及模型層的投資敘事。