小米釋出了其機器人AI模型 Xiaomi-Robotics-1,該模型遵循與大型語言模型相似的縮放規律——效能隨訓練資料量增加而提升。但與傳統方法不同,小米在資料採集環節幾乎完全繞開了實體機器人,轉而使用一種行動式手持夾爪裝置來收集運動資料。
機器人AI面臨一個語言模型不存在的獨特資料難題:LLM可以大規模利用網際網路公開文本,而機器人運動資料卻極為稀缺。傳統做法需要人類遠端操控實體機器人完成每一個動作,過程緩慢、成本高昂,且往往在相同場景中產生重複資料。小米團隊使用配備攝像頭的手持夾爪,讓操作者直接在廚房、辦公室、商店、工廠車間和戶外空間等真實環境中錄製操作動作,無需機器人本體在場。這一方法最終採集了超過 10萬小時 的運動記錄,覆蓋 1700多種 不同環境。
如此大規模的資料集帶來了新的標註挑戰。手動為每個動作片段新增描述不切實際,小米轉而使用另一AI模型自動為每段運動生成文本描述,據稱整個資料集在約 兩週 內完成標註。隨後,這些訓練成果被遷移至實體機器人,包括輪式機器人和雙臂系統,模型還需適應手持夾爪與機械臂之間的物理差異。
測試結果顯示,增加模型規模確實能提升效能,但擴大訓練資料量帶來的收益遠大於增加算力投入。研究人員表示,機器人AI的進步將主要取決於能否收集更大、更多樣的資料集。這一發現與2026年3月視覺資料領域的研究結論一致:當模型需要處理影像而非純文本時,增加資料比擴大模型規模更有效。
在實體機器人測試中,隨著訓練資料量增加,模型在陌生環境中的成功率從約 25% 提升至 75%。研究人員稱尚未觀察到資料收益遞減的拐點。在標準機器人AI基準測試中,Xiaomi-Robotics-1取得了迄今最佳成績。在一項演示中,機器人耗時十餘分鐘、橫跨整個房間,自主完成了整理行李箱的任務。
基礎模型的價值還體現在快速適應新任務的能力上。小米在包裝手機、將衣物放入洗衣機、向印表機送紙、裝箱等四項任務中進行了測試,每項任務僅使用不到 10小時 的訓練資料,模型平均成功率即達到 75%。相比之下,競爭對手 Physical Intelligence 的模型在同一測試中僅達到 40%。小米表示,其模型在處理紙張等柔軟可變形材料以及需要移動的任務上表現尤為突出。在 RoboCasa365 排行榜上,Xiaomi-Robotics-1 大幅領先,尤其在未見過的複合任務上優勢明顯。
機器人資料仍是該領域的研究焦點,各團隊正探索截然不同的路徑。2026年5月一項關於World Action Models的調查回顧了約100項研究,指出遙操作資料精確但成本高、場景受限,小米的手持夾爪正是針對這些限制設計的。輝達、卡內基梅隆大學和加州大學伯克利分校通過 ENPIRE 專案,讓AI編碼代理自主教會八台機器人抓取物體;輝達還試圖將資料問題轉化為算力問題,通過生成合成訓練資料來解決。中國 BAAI 研究所則走相反路線,其 Orca 世界模型從 12.5萬小時 無動作標籤的影片中學習,在五項操作任務上仍能與專用模型 pi0.5 匹敵。小米自動化標註並規模化應用,而Orca試圖完全消除標籤。
儘管Xiaomi-Robotics-1在多個基準上領先,其絕對成功率仍處於低位。Physical Intelligence 的 pi0.7 模型在2026年4月曾因聲稱能泛化但可能只是回憶相似訓練資料而受到批評。小米的研究表明,機器人AI的縮放規律與語言模型存在根本差異,未來突破的關鍵可能不在於更大的模型,而在於更豐富、更廉價的資料採集方式。