在2026年上海世界人工智能大会(WAIC)期间,一场名为“智启具身论坛2026——迎接物理AI智能涌现”的圆桌讨论成为焦点。论坛汇集了具身智能领域多家代表性公司的高管与顶尖高校研究者,包括智元合伙人兼觅蜂科技CEO姚卯青、Sunday Robotics联合创始人赵子豪、腾讯首席科学家张正友、Dyna Robotics联合创始人马也骋、Physical Intelligence(PI) 研究科学家任至意,以及佐治亚理工学院教授徐丹飞。他们围绕数据来源、模型演进与软硬件整合等行业尚未有定论的硬核问题展开了深入对话。
论坛最后,主持人抛出了一个所有人都关心的问题:机器人的“ChatGPT时刻”到底什么时候来?六位嘉宾给出了各自的时间预测,尽管技术路线和产品落地方式不同,但答案惊人地接近:姚卯青认为是两年,赵子豪说三年以内,张正友给出三到五年,马也骋估计四年左右,任至意预测四到五年,徐丹飞则给出了五年的答案。然而,这些数字背后的口径并不完全一致。姚卯青给出了相对明确的定义:机器人能够开箱即用,听懂开放式自然语言指令,并在常见任务上达到70%至80%的基础成功率。但其他嘉宾并未逐一定义自己的标准,因此,行业对“什么才算机器人的ChatGPT时刻”尚未形成共识。
讨论中,数据飞轮如何形成是第一个核心议题。大语言模型依赖互联网上已有的海量文本数据,但机器人所需的物理经验没有统一来源。姚卯青估算,头部语言模型预训练已达100万亿Token量级,而要让机器人开箱即用,可能需要一亿小时级别的数据。真机数据质量高但成本昂贵,仿真数据易扩大规模却存在虚实差距。一种被反复提及的低成本数据采集方式UMI(人类操作数据采集)被赵子豪视为短期内最高效的规模化来源,但他强调长期真正重要的是部署数据——即机器人在真实场景中干活时产生的数据。马也骋则提出了一个“数据金字塔”模型:底层是互联网视频和人类第一视角数据,中间是真机多任务数据,塔尖是价值最高的部署数据,尤其是机器人犯错、停顿、恢复并最终完成任务的过程。Dyna在酒店部署机器人折毛巾时,会将前几次部署的数据重新放回预训练,随着数据积累,进入新酒店所需的适配时间逐渐缩短。
第二个焦点是模型路线的争论,即“VLA已死”是否成立。VLA(视觉-语言-动作模型)与WAM(世界动作模型)被视作两条不同路线。Dyna Robotics已从早期VLA转向WAM,马也骋认为在强调鲁棒性和高成功率的任务中WAM更高效。但PI的任至意并不认同,他指出目前没有模型能明显超越PI推出的π0.7(通用机器人模型),且VLA与WAM并不冲突,PI的做法是先生成未来的子目标画面,再用其引导底层模型执行动作。智元也在推动VLA与WAM的融合。张正友则进一步指出,具身智能远未形成类似Transformer的统一架构,一个真正的机器人智能体至少需要包含认知系统、感知行动系统和底层反应系统的分层体系,不可能靠一个模型解决所有问题。因此,“VLA已死”可能是个伪命题,真正可能消亡的是“靠一个模型解决所有问题”的想象。
第三个问题是机器人公司是否应走向软硬件全栈。PI现阶段只做通用基础模型,不研发和销售本体,任至意表示这是为了优先保证模型快速迭代。腾讯也明确只做“大脑”不卖本体,张正友笑称腾讯过去做硬件基本没成功过,但实验室仍保留硬件研发,因为不懂本体就无法理解触觉、力觉等对模型的限制。智元则走全栈路线,姚卯青认为机器人进入客户现场后,可靠性、成本、成功率和一致性无法仅靠模型解决,端侧芯片、电池、关节控制等都会决定智能上限。Sunday Robotics选择三指夹爪,赵子豪认为这是用20%的成本获得80%的能力。论坛得出的判断是:全栈能力会成为趋势,但全栈商业模式未必是唯一答案。未来行业可能同时出现类似苹果(软硬件一体)和类似安卓(只做通用大脑)的公司。
整场论坛传递出的核心信号是:机器人行业远未收敛。产品形态、模型架构、数据配方和商业模式都处于分散探索阶段。对于投资者而言,这种“混乱”也意味着机会——在尚未收敛的赛道中,没有玩家提前拿到标准答案。机器人的“ChatGPT时刻”不会由某一次模型发布宣布到来,其真正标志将是数据、模型、本体与真实部署第一次形成自我加速的飞轮。在此之前,所有时间表都只是预测,所有路线都还在验证。