7月19日,2026世界人工智能大会(WAIC)核心分论坛“智启具身论坛2026——迎接物理AI智能涌现”在上海世博中心举行。论坛由智元与觅蜂科技联合主办,汇聚了清华大学、佐治亚理工学院、Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics及腾讯Robotics X等机构代表,聚焦物理AI的数据来源、模型路线、仿真训练与商业化部署。

智元合伙人、高级副总裁、具身业务部总裁,觅蜂科技董事长兼CEO姚卯青在主旨演讲中提出,物理AI要从“模型演示”跨向规模化作业,必须突破三堵“物理墙”。第一是数据墙:真实交互数据稀缺且采集成本高,难以像互联网文本那样低成本规模化获取。第二是表征墙:跨任务、跨环境、跨机器人的统一物理表征尚未形成。第三是闭环墙:真实世界试错成本高,一次失败可能导致零部件甚至整机损失。姚卯青表示,当前具身数据量级与头部大语言模型训练数据相比可能相差1万倍以上。他预计,若将机器人“ChatGPT时刻”定义为机器人能够“开箱即用”、理解开放式自然语言指令并完成日常任务,行业或需积累1亿小时级别的具身数据,推动常见任务的基础成功率达到70%至80%。

在数据获取路径上,多位嘉宾分享了不同策略。Physical Intelligence研究科学家任至意认为,具身学习不能仅追求数据量扩张,模型还需理解任务、环境、策略等上下文信息。他介绍,PI在训练π0.7模型时引入了历史视频编码、细粒度语言与图像引导以及数据质量评分等元数据,以增强模型对不同任务条件的判断能力。佐治亚理工学院助理教授徐丹飞则提出,人类第一视角数据可能成为扩展训练数据的重要来源,其团队已积累约2万小时数据,并在部分复杂操作任务中观察到具身学习的Scaling规律。但他强调,人类数据不能直接替代真机数据,仍需结合多样化真机数据解决迁移问题。Genesis AI联合创始人王尊玄认为,具身智能是系统工程,应将数据采集、硬件设计、仿真训练、模型评测等纳入统一端到端体系。

商业化场景更关注机器人的稳定性和可靠性。Dyna Robotics联合创始人兼首席科学家马也骋表示,当前不少通用模型能覆盖多个任务,但单一任务成功率有限,“如果成功率不高,其实没有很大的商业价值”。他介绍,Dyna Robotics已积累超过20万小时预训练数据,并采用“数据金字塔”策略,尤其关注机器人在任务中出错、恢复并最终完成的过程。他举例称,团队曾在餐巾折叠任务中实现机器人连续24小时无人干预作业,完成超过800个餐巾折叠。智元也在论坛上披露了在江西南昌龙旗合作工厂的3C产线部署案例:机器人完成连续6天、每日超过10小时的全工段直播作业,累计完成近6.5万件操作,整体成功率达到99.99%

围绕技术路线,论坛未形成单一结论,但“融合发展”成为多数嘉宾的共识。腾讯首席科学家、腾讯Robotics X实验室主任张正友认为,具身智能仍处早期阶段,尚未出现类似Transformer之于大语言模型的统一技术框架。他表示,具身智能体至少需要认知、感知—行动和肢体反应等多层闭环协同。在压轴圆桌环节,多位嘉宾就机器人“ChatGPT时刻”给出时间预判:姚卯青认为2年,任至意给出4至5年,徐丹飞认为5年,马也骋给出4年,张正友认为3至5年,赵子豪认为3年以内。张正友强调,时间预测不应寄望于单一模型或数据源的突然突破,而取决于数据采集、真实部署、失败恢复和硬件系统的持续推进。