在2026年上海世界人工智慧大會(WAIC)期間,一場名為“智啟具身論壇2026——迎接物理AI智慧湧現”的圓桌討論成為焦點。論壇彙集了具身智慧領域多家代表性公司的高管與頂尖高校研究者,包括智元合夥人兼覓蜂科技CEO姚卯青、Sunday Robotics聯合創始人趙子豪、騰訊首席科學家張正友、Dyna Robotics聯合創始人馬也騁、Physical Intelligence(PI) 研究科學家任至意,以及佐治亞理工學院教授徐丹飛。他們圍繞資料來源、模型演進與軟硬體整合等行業尚未有定論的硬核問題展開了深入對話。
論壇最後,主持人丟擲了一個所有人都關心的問題:機器人的“ChatGPT時刻”到底什麼時候來?六位嘉賓給出了各自的時間預測,儘管技術路線和產品落地方式不同,但答案驚人地接近:姚卯青認為是兩年,趙子豪說三年以內,張正友給出三到五年,馬也騁估計四年左右,任至意預測四到五年,徐丹飛則給出了五年的答案。然而,這些數字背後的口徑並不完全一致。姚卯青給出了相對明確的定義:機器人能夠開箱即用,聽懂開放式自然語言指令,並在常見任務上達到70%至80%的基礎成功率。但其他嘉賓並未逐一定義自己的標準,因此,行業對“什麼才算機器人的ChatGPT時刻”尚未形成共識。
討論中,資料飛輪如何形成是第一個核心議題。大語言模型依賴網際網路上已有的海量文本資料,但機器人所需的物理經驗沒有統一來源。姚卯青估算,頭部語言模型預訓練已達100萬億Token量級,而要讓機器人開箱即用,可能需要一億小時級別的資料。真機資料質量高但成本昂貴,模擬資料易擴大規模卻存在虛實差距。一種被反覆提及的低成本資料採集方式UMI(人類操作資料採集)被趙子豪視為短期內最高效的規模化來源,但他強調長期真正重要的是部署資料——即機器人在真實場景中幹活時產生的資料。馬也騁則提出了一個“資料金字塔”模型:底層是網際網路影片和人類第一視角資料,中間是真機多工資料,塔尖是價值最高的部署資料,尤其是機器人犯錯、停頓、恢復並最終完成任務的過程。Dyna在酒店部署機器人折毛巾時,會將前幾次部署的資料重新放回預訓練,隨著資料積累,進入新酒店所需的適配時間逐漸縮短。
第二個焦點是模型路線的爭論,即“VLA已死”是否成立。VLA(視覺-語言-動作模型)與WAM(世界動作模型)被視作兩條不同路線。Dyna Robotics已從早期VLA轉向WAM,馬也騁認為在強調魯棒性和高成功率的任務中WAM更高效。但PI的任至意並不認同,他指出目前沒有模型能明顯超越PI推出的π0.7(通用機器人模型),且VLA與WAM並不衝突,PI的做法是先生成未來的子目標畫面,再用其引導底層模型執行動作。智元也在推動VLA與WAM的融合。張正友則進一步指出,具身智慧遠未形成類似Transformer的統一架構,一個真正的機器人智慧體至少需要包含認知系統、感知行動系統和底層反應系統的分層體系,不可能靠一個模型解決所有問題。因此,“VLA已死”可能是個偽命題,真正可能消亡的是“靠一個模型解決所有問題”的想象。
第三個問題是機器人公司是否應走向軟硬體全棧。PI現階段只做通用基礎模型,不研發和銷售本體,任至意表示這是為了優先保證模型快速迭代。騰訊也明確只做“大腦”不賣本體,張正友笑稱騰訊過去做硬體基本沒成功過,但實驗室仍保留硬體研發,因為不懂本體就無法理解觸覺、力覺等對模型的限制。智元則走全棧路線,姚卯青認為機器人進入客戶現場後,可靠性、成本、成功率和一致性無法僅靠模型解決,端側晶片、電池、關節控制等都會決定智慧上限。Sunday Robotics選擇三指夾爪,趙子豪認為這是用20%的成本獲得80%的能力。論壇得出的判斷是:全棧能力會成為趨勢,但全棧商業模式未必是唯一答案。未來行業可能同時出現類似蘋果(軟硬體一體)和類似安卓(只做通用大腦)的公司。
整場論壇傳遞出的核心訊號是:機器人行業遠未收斂。產品形態、模型架構、資料配方和商業模式都處於分散探索階段。對於投資者而言,這種“混亂”也意味著機會——在尚未收斂的賽道中,沒有玩家提前拿到標準答案。機器人的“ChatGPT時刻”不會由某一次模型釋出宣佈到來,其真正標誌將是資料、模型、本體與真實部署第一次形成自我加速的飛輪。在此之前,所有時間表都只是預測,所有路線都還在驗證。