面壁智慧在2025年世界人工智慧大會(WAIC)期間正式釋出並開源了MiniCPM-Robot系列模型,同時推出了開源具身智慧推理框架PhyAI。該系列包含兩個主要模型:專注於操控任務的MiniCPM-RobotManip(1.5B引數)和專注於跟蹤任務的MiniCPM-RobotTrack(0.9B引數)。
在真機演示中,搭載MiniCPM-RobotManip的雙臂機器人能夠協作完成製作三明治的複雜任務,包括取麵包、夾生菜、火腿和雞蛋等步驟。而搭載MiniCPM-RobotTrack的機器狗則能在室外、辦公樓、電梯及地下停車場等環境中穩定跟蹤指定目標,即使在弱網甚至無網環境下也能繼續識別目標並規劃動作。
在效能方面,MiniCPM-Robot系列在LIBERO、Calvin、RoboTwin2等主流VLA評測中整體表現進入第一梯隊,與π0.5等模型處於相近水平。MiniCPM-RobotManip在專門考察上下文記憶的RMBench中得分約53分,而π0.5僅約10分,接近隨機水平。在單幀推理延遲方面,MiniCPM-RobotManip在H100顯示卡、bf16精度下約為120毫秒,接近π0.5(約234毫秒)的一半。
MiniCPM-RobotTrack在未進行下游強化學習最佳化的情況下,於單目標跟蹤、多人干擾跟蹤和模糊目標跟蹤三類任務上的追蹤率分別達到89.8%、73.4%和80.4%,均取得開源方案中的最優結果。相比OpenTrackVLA,三項追蹤率分別提高7.0、14.6和6.5個百分點。在相同單視角、純SFT設定下,與閉源模型TrackVLA++相比,其在單目標跟蹤和模糊目標跟蹤上的追蹤率分別高出8.8和17.0個百分點,模糊目標跟蹤成功率達到58.0%。
MiniCPM-RobotManip基於面壁此前開源的MiniCPM-V 4.6多模態模型訓練而來,該模型開源不到兩個月下載量已突破200萬。面壁的MiniCPM-V/O系列已持續迭代兩年多,開源總下載量超過2500萬。模型採用流式計算架構,避免重複計算歷史資訊,從而降低推理計算量。團隊還將約200毫秒視為機器人操作體驗的臨界線,確保機械臂和機器狗的動作流暢。
MiniCPM-RobotTrack僅依賴宇樹Go2 Edu原裝攝像頭和本地算力,無需額外安裝目標檢測或識別模組,即可完成多種跟蹤任務。團隊通過資料清洗、模擬與真實環境閉環訓練,持續增強模型應對目標橫穿、快速轉向、短時遮擋、多人交叉等長尾問題的能力。經過系統級最佳化,該模型在機器狗原生本地算力上可穩定達到5Hz以上,端到端響應延遲約180毫秒。
面壁此次開源的內容不僅包括模型權重,還涵蓋環境安裝、模型載入、攝像頭接入、文本指令輸入、控制介面及一鍵啟動指令碼,支援完全本地執行,無需依賴雲端伺服器。
同時釋出的PhyAI推理框架由明體科技聯合北京郵電大學、北京大學研發,旨在降低具身模型適配真實機器人的工程成本。在RTX 5090上執行π0、π0.5和GR00T時,PhyAI相較模型官方倉庫分別實現約2.85倍、1.82倍和2.28倍加速。適配MiniCPM-Robot系列時,PhyAI通過CUDA Graph將推理幀率從10.12Hz提升至33.28Hz,再通過定製融合運算元進一步在NVIDIA H20上提高到36.77Hz。
面壁智慧還與樂聚機器人合作,將端側多模態大模型、夸父機器人本體和導航系統組合,推出展廳導覽Agent和園區巡檢Agent,可在無網環境下完成離線講解、自由問答及避障導航。與吉利的合作則通過RoboHarness框架將VLM、VLA、機器人本體和導航系統整合,執行倉儲中的長程任務。
面壁智慧表示,當前多數VLA基礎模型控制在4B以內,模型繼續做大能帶來多少真實操作收益仍在驗證。團隊更看重模型的基礎性、泛化性和通用性,希望先打磨資料、基礎設施和工程鏈路,讓基礎能力提升後自然覆蓋更多場景。