7月19日上午,面壁智慧聯合OpenBMB在世界人工智慧大會(WAIC 2026)上正式釋出並開源了其首個具身智慧技術成果——MiniCPM-Robot系列模型,標誌著這家以端側小模型聞名的公司正式進軍機器人領域。

該系列包含兩個模型:通用VLA(視覺-語言-動作)模型MiniCPM-RobotManip,以及面向移動機器人跟蹤導航的MiniCPM-RobotTrack。MiniCPM-RobotManip基於面壁智慧最新多模態端側模型MiniCPM-V 4.6訓練,引數規模僅1.5B,但效能可比肩體量更大的3-4B模型,同時流式即時推理計算成本減半。模型支援1分鐘的具身原生記憶,能高效完成需要上下文記憶的複雜操作任務,例如在RMBench基準測試中得分53,遠超主流模型π0.5的10分。

MiniCPM-RobotTrack由面壁智慧與南京大學合作研發,是業內首個支援真實本地斷網部署的跟蹤模型,僅依靠機器人原裝攝像頭和本地算力即可完成單目標、動態多目標及模糊目標跟蹤。該模型引數僅0.9B,在宇樹Go2 Edu機器狗上實測穩定達到5+ Hz,端到端響應時延約180毫秒。即使在現場拔掉網絡卡,機器狗仍能依靠本地視覺畫面與文本指令持續完成目標識別、跟蹤與運動控制。在單目標、動態多目標和模糊目標跟蹤任務中,追蹤率分別達到89.8、73.4和80.4,均為開源方案最優,相比OmTrackVLA分別提升7.0、14.6和6.5個百分點。

兩款模型均獲得具身智慧推理框架PhyAI的支援。PhyAI專為端側極速推理與雲端大規模Rollout場景設計,通過CUDA Graph加速和運算元融合,將MiniCPM-Robot在NVIDIA H20上的推理幀率提升至36.77 Hz

在產業落地方面,面壁智慧已與樂聚機器人合作推出展廳導覽和園區巡檢Agent解決方案,並與吉利汽車圍繞VLA模型、生產倉儲應用等方向展開合作。目前,MiniCPM-Robot系列模型已在GitHub和Hugging Face上完全開源,提供完整部署流程與一鍵啟動指令碼,開發者可開箱即用。