面壁智能在2025年世界人工智能大会(WAIC)期间正式发布并开源了MiniCPM-Robot系列模型,同时推出了开源具身智能推理框架PhyAI。该系列包含两个主要模型:专注于操控任务的MiniCPM-RobotManip(1.5B参数)和专注于跟踪任务的MiniCPM-RobotTrack(0.9B参数)。

在真机演示中,搭载MiniCPM-RobotManip的双臂机器人能够协作完成制作三明治的复杂任务,包括取面包、夹生菜、火腿和鸡蛋等步骤。而搭载MiniCPM-RobotTrack的机器狗则能在室外、办公楼、电梯及地下停车场等环境中稳定跟踪指定目标,即使在弱网甚至无网环境下也能继续识别目标并规划动作。

在性能方面,MiniCPM-Robot系列在LIBEROCalvinRoboTwin2等主流VLA评测中整体表现进入第一梯队,与π0.5等模型处于相近水平。MiniCPM-RobotManip在专门考察上下文记忆的RMBench中得分约53分,而π0.5仅约10分,接近随机水平。在单帧推理延迟方面,MiniCPM-RobotManip在H100显卡、bf16精度下约为120毫秒,接近π0.5(约234毫秒)的一半。

MiniCPM-RobotTrack在未进行下游强化学习优化的情况下,于单目标跟踪、多人干扰跟踪和模糊目标跟踪三类任务上的追踪率分别达到89.8%73.4%80.4%,均取得开源方案中的最优结果。相比OpenTrackVLA,三项追踪率分别提高7.0、14.6和6.5个百分点。在相同单视角、纯SFT设定下,与闭源模型TrackVLA++相比,其在单目标跟踪和模糊目标跟踪上的追踪率分别高出8.8和17.0个百分点,模糊目标跟踪成功率达到58.0%

MiniCPM-RobotManip基于面壁此前开源的MiniCPM-V 4.6多模态模型训练而来,该模型开源不到两个月下载量已突破200万。面壁的MiniCPM-V/O系列已持续迭代两年多,开源总下载量超过2500万。模型采用流式计算架构,避免重复计算历史信息,从而降低推理计算量。团队还将约200毫秒视为机器人操作体验的临界线,确保机械臂和机器狗的动作流畅。

MiniCPM-RobotTrack仅依赖宇树Go2 Edu原装摄像头和本地算力,无需额外安装目标检测或识别模块,即可完成多种跟踪任务。团队通过数据清洗、仿真与真实环境闭环训练,持续增强模型应对目标横穿、快速转向、短时遮挡、多人交叉等长尾问题的能力。经过系统级优化,该模型在机器狗原生本地算力上可稳定达到5Hz以上,端到端响应延迟约180毫秒

面壁此次开源的内容不仅包括模型权重,还涵盖环境安装、模型加载、摄像头接入、文本指令输入、控制接口及一键启动脚本,支持完全本地运行,无需依赖云端服务器。

同时发布的PhyAI推理框架由明体科技联合北京邮电大学、北京大学研发,旨在降低具身模型适配真实机器人的工程成本。在RTX 5090上运行π0、π0.5和GR00T时,PhyAI相较模型官方仓库分别实现约2.85倍1.82倍2.28倍加速。适配MiniCPM-Robot系列时,PhyAI通过CUDA Graph将推理帧率从10.12Hz提升至33.28Hz,再通过定制融合算子进一步在NVIDIA H20上提高到36.77Hz

面壁智能还与乐聚机器人合作,将端侧多模态大模型、夸父机器人本体和导航系统组合,推出展厅导览Agent和园区巡检Agent,可在无网环境下完成离线讲解、自由问答及避障导航。与吉利的合作则通过RoboHarness框架将VLM、VLA、机器人本体和导航系统整合,执行仓储中的长程任务。

面壁智能表示,当前多数VLA基础模型控制在4B以内,模型继续做大能带来多少真实操作收益仍在验证。团队更看重模型的基础性、泛化性和通用性,希望先打磨数据、基础设施和工程链路,让基础能力提升后自然覆盖更多场景。