7月19日,2026世界人工智慧大會(WAIC)核心分論壇“智啟具身論壇2026——迎接物理AI智慧湧現”在上海世博中心舉行。論壇由智元與覓蜂科技聯合主辦,匯聚了清華大學、佐治亞理工學院、Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics及騰訊Robotics X等機構代表,聚焦物理AI的資料來源、模型路線、模擬訓練與商業化部署。

智元合夥人、高階副總裁、具身業務部總裁,覓蜂科技董事長兼CEO姚卯青在主旨演講中提出,物理AI要從“模型演示”跨向規模化作業,必須突破三堵“物理牆”。第一是資料牆:真實互動資料稀缺且採集成本高,難以像網際網路文本那樣低成本規模化獲取。第二是表徵牆:跨任務、跨環境、跨機器人的統一物理表徵尚未形成。第三是閉環牆:真實世界試錯成本高,一次失敗可能導致零部件甚至整機損失。姚卯青表示,當前具身資料量級與頭部大語言模型訓練資料相比可能相差1萬倍以上。他預計,若將機器人“ChatGPT時刻”定義為機器人能夠“開箱即用”、理解開放式自然語言指令並完成日常任務,行業或需積累1億小時級別的具身資料,推動常見任務的基礎成功率達到70%至80%。

在資料獲取路徑上,多位嘉賓分享了不同策略。Physical Intelligence研究科學家任至意認為,具身學習不能僅追求資料量擴張,模型還需理解任務、環境、策略等上下文資訊。他介紹,PI在訓練π0.7模型時引入了歷史影片編碼、細粒度語言與影像引導以及資料質量評分等後設資料,以增強模型對不同任務條件的判斷能力。佐治亞理工學院助理教授徐丹飛則提出,人類第一視角資料可能成為擴充套件訓練資料的重要來源,其團隊已積累約2萬小時資料,並在部分複雜操作任務中觀察到具身學習的Scaling規律。但他強調,人類資料不能直接替代真機資料,仍需結合多樣化真機資料解決遷移問題。Genesis AI聯合創始人王尊玄認為,具身智慧是系統工程,應將資料採集、硬體設計、模擬訓練、模型評測等納入統一端到端體系。

商業化場景更關注機器人的穩定性和可靠性。Dyna Robotics聯合創始人兼首席科學家馬也騁表示,當前不少通用模型能覆蓋多個任務,但單一任務成功率有限,“如果成功率不高,其實沒有很大的商業價值”。他介紹,Dyna Robotics已積累超過20萬小時預訓練資料,並採用“資料金字塔”策略,尤其關注機器人在任務中出錯、恢復並最終完成的過程。他舉例稱,團隊曾在餐巾摺疊任務中實現機器人連續24小時無人干預作業,完成超過800個餐巾摺疊。智元也在論壇上披露了在江西南昌龍旗合作工廠的3C產線部署案例:機器人完成連續6天、每日超過10小時的全工段直播作業,累計完成近6.5萬件操作,整體成功率達到99.99%

圍繞技術路線,論壇未形成單一結論,但“融合發展”成為多數嘉賓的共識。騰訊首席科學家、騰訊Robotics X實驗室主任張正友認為,具身智慧仍處早期階段,尚未出現類似Transformer之於大語言模型的統一技術框架。他表示,具身智慧體至少需要認知、感知—行動和肢體反應等多層閉環協同。在壓軸圓桌環節,多位嘉賓就機器人“ChatGPT時刻”給出時間預判:姚卯青認為2年,任至意給出4至5年,徐丹飛認為5年,馬也騁給出4年,張正友認為3至5年,趙子豪認為3年以內。張正友強調,時間預測不應寄望於單一模型或資料來源的突然突破,而取決於資料採集、真實部署、失敗恢復和硬體系統的持續推進。