7月19日上午,面壁智能联合OpenBMB在世界人工智能大会(WAIC 2026)上正式发布并开源了其首个具身智能技术成果——MiniCPM-Robot系列模型,标志着这家以端侧小模型闻名的公司正式进军机器人领域。
该系列包含两个模型:通用VLA(视觉-语言-动作)模型MiniCPM-RobotManip,以及面向移动机器人跟踪导航的MiniCPM-RobotTrack。MiniCPM-RobotManip基于面壁智能最新多模态端侧模型MiniCPM-V 4.6训练,参数规模仅1.5B,但性能可比肩体量更大的3-4B模型,同时流式实时推理计算成本减半。模型支持1分钟的具身原生记忆,能高效完成需要上下文记忆的复杂操作任务,例如在RMBench基准测试中得分53,远超主流模型π0.5的10分。
MiniCPM-RobotTrack由面壁智能与南京大学合作研发,是业内首个支持真实本地断网部署的跟踪模型,仅依靠机器人原装摄像头和本地算力即可完成单目标、动态多目标及模糊目标跟踪。该模型参数仅0.9B,在宇树Go2 Edu机器狗上实测稳定达到5+ Hz,端到端响应时延约180毫秒。即使在现场拔掉网卡,机器狗仍能依靠本地视觉画面与文本指令持续完成目标识别、跟踪与运动控制。在单目标、动态多目标和模糊目标跟踪任务中,追踪率分别达到89.8、73.4和80.4,均为开源方案最优,相比OmTrackVLA分别提升7.0、14.6和6.5个百分点。
两款模型均获得具身智能推理框架PhyAI的支持。PhyAI专为端侧极速推理与云端大规模Rollout场景设计,通过CUDA Graph加速和算子融合,将MiniCPM-Robot在NVIDIA H20上的推理帧率提升至36.77 Hz。
在产业落地方面,面壁智能已与乐聚机器人合作推出展厅导览和园区巡检Agent解决方案,并与吉利汽车围绕VLA模型、生产仓储应用等方向展开合作。目前,MiniCPM-Robot系列模型已在GitHub和Hugging Face上完全开源,提供完整部署流程与一键启动脚本,开发者可开箱即用。