具身智慧的競爭焦點正在從“機器人能不能動”轉向“能不能理解並預測物理世界”。2026年以來,純VLA(視覺-語言-動作模型)在長時程任務、複雜環境泛化和異常恢復上的侷限逐漸暴露,VLA與世界動作模型WAM的融合開始成為主流廠商的共同方向。這一架構變化不僅關乎演算法本身,還在重新定義硬體價值鏈:3D視覺、觸覺、六維力、靈巧手和資料採集裝置的重要性持續提升,中國供應鏈的優勢也可能從低成本製造進一步延伸至真實世界資料閉環。
過去兩年,VLA逐漸成為具身智慧“大腦”的主流技術路線。其核心邏輯是將視覺感知、語言理解和動作輸出連線起來,使機器人能夠根據環境資訊和自然語言指令直接產生操作行為。相比依賴人工程式設計和固定軌跡的傳統機器人,VLA顯著提升了任務理解和泛化能力,使機器人真正具備從“看懂”走向“行動”的基礎。然而,真實世界並非連續發生的一組獨立動作。完成一次抓杯可能只需數秒,但“開啟冰箱、找到牛奶、取出、倒入杯中、放回原位並關門”這類長時程任務,要求模型持續跟蹤環境變化,並判斷每一步操作如何影響下一步。當任務鏈條拉長,純粹依賴“當前觀察—下一動作”的模型更容易出現誤差累積,陌生物體、位置變化或一次動作失敗都可能打斷整條任務鏈。
為應對這些侷限,具身智慧的“大腦”正從VLM、VLA進一步向“多模態大模型+世界模型”演化。World Model的核心任務是學習物理環境的狀態轉移,即理解當前世界處於什麼狀態,以及某個動作執行後環境可能怎樣變化;WAM(World Action Model,世界動作模型)則進一步把這種預測能力與機器人動作生成結合起來,讓機器人不僅知道“下一步做什麼”,還能預判“動作之後世界會發生什麼”。這種能力對長時程任務和異常恢復至關重要。
模型架構的變化正在傳導至硬體層面。由於WAM需要更豐富的環境感知與狀態預測,3D視覺、觸覺、六維力感測器、靈巧手以及資料採集裝置的重要性持續提升。這些硬體不僅是執行任務的工具,更是構建真實世界資料閉環的關鍵入口。中國供應鏈的優勢可能因此從低成本製造進一步延伸至資料採集與閉環構建環節,從而在具身智慧價值鏈中佔據更有利的位置。
當機器人開始學習“動作之後世界會發生什麼”,產業價值鏈將如何重新排序?這已成為具身智慧領域投資者和從業者共同關注的核心問題。