小米发布了其机器人AI模型 Xiaomi-Robotics-1,该模型遵循与大型语言模型相似的缩放规律——性能随训练数据量增加而提升。但与传统方法不同,小米在数据采集环节几乎完全绕开了实体机器人,转而使用一种便携式手持夹爪设备来收集运动数据。

机器人AI面临一个语言模型不存在的独特数据难题:LLM可以大规模利用互联网公开文本,而机器人运动数据却极为稀缺。传统做法需要人类远程操控实体机器人完成每一个动作,过程缓慢、成本高昂,且往往在相同场景中产生重复数据。小米团队使用配备摄像头的手持夹爪,让操作者直接在厨房、办公室、商店、工厂车间和户外空间等真实环境中录制操作动作,无需机器人本体在场。这一方法最终采集了超过 10万小时 的运动记录,覆盖 1700多种 不同环境。

如此大规模的数据集带来了新的标注挑战。手动为每个动作片段添加描述不切实际,小米转而使用另一AI模型自动为每段运动生成文本描述,据称整个数据集在约 两周 内完成标注。随后,这些训练成果被迁移至实体机器人,包括轮式机器人和双臂系统,模型还需适应手持夹爪与机械臂之间的物理差异。

测试结果显示,增加模型规模确实能提升性能,但扩大训练数据量带来的收益远大于增加算力投入。研究人员表示,机器人AI的进步将主要取决于能否收集更大、更多样的数据集。这一发现与2026年3月视觉数据领域的研究结论一致:当模型需要处理图像而非纯文本时,增加数据比扩大模型规模更有效。

在实体机器人测试中,随着训练数据量增加,模型在陌生环境中的成功率从约 25% 提升至 75%。研究人员称尚未观察到数据收益递减的拐点。在标准机器人AI基准测试中,Xiaomi-Robotics-1取得了迄今最佳成绩。在一项演示中,机器人耗时十余分钟、横跨整个房间,自主完成了整理行李箱的任务。

基础模型的价值还体现在快速适应新任务的能力上。小米在包装手机、将衣物放入洗衣机、向打印机送纸、装箱等四项任务中进行了测试,每项任务仅使用不到 10小时 的训练数据,模型平均成功率即达到 75%。相比之下,竞争对手 Physical Intelligence 的模型在同一测试中仅达到 40%。小米表示,其模型在处理纸张等柔软可变形材料以及需要移动的任务上表现尤为突出。在 RoboCasa365 排行榜上,Xiaomi-Robotics-1 大幅领先,尤其在未见过的复合任务上优势明显。

机器人数据仍是该领域的研究焦点,各团队正探索截然不同的路径。2026年5月一项关于World Action Models的调查回顾了约100项研究,指出遥操作数据精确但成本高、场景受限,小米的手持夹爪正是针对这些限制设计的。英伟达、卡内基梅隆大学和加州大学伯克利分校通过 ENPIRE 项目,让AI编码代理自主教会八台机器人抓取物体;英伟达还试图将数据问题转化为算力问题,通过生成合成训练数据来解决。中国 BAAI 研究所则走相反路线,其 Orca 世界模型从 12.5万小时 无动作标签的视频中学习,在五项操作任务上仍能与专用模型 pi0.5 匹敌。小米自动化标注并规模化应用,而Orca试图完全消除标签。

尽管Xiaomi-Robotics-1在多个基准上领先,其绝对成功率仍处于低位。Physical Intelligence 的 pi0.7 模型在2026年4月曾因声称能泛化但可能只是回忆相似训练数据而受到批评。小米的研究表明,机器人AI的缩放规律与语言模型存在根本差异,未来突破的关键可能不在于更大的模型,而在于更丰富、更廉价的数据采集方式。