具身智能的竞争焦点正在从“机器人能不能动”转向“能不能理解并预测物理世界”。2026年以来,纯VLA(视觉-语言-动作模型)在长时程任务、复杂环境泛化和异常恢复上的局限逐渐暴露,VLA与世界动作模型WAM的融合开始成为主流厂商的共同方向。这一架构变化不仅关乎算法本身,还在重新定义硬件价值链:3D视觉、触觉、六维力、灵巧手和数据采集设备的重要性持续提升,中国供应链的优势也可能从低成本制造进一步延伸至真实世界数据闭环。
过去两年,VLA逐渐成为具身智能“大脑”的主流技术路线。其核心逻辑是将视觉感知、语言理解和动作输出连接起来,使机器人能够根据环境信息和自然语言指令直接产生操作行为。相比依赖人工编程和固定轨迹的传统机器人,VLA显著提升了任务理解和泛化能力,使机器人真正具备从“看懂”走向“行动”的基础。然而,真实世界并非连续发生的一组独立动作。完成一次抓杯可能只需数秒,但“打开冰箱、找到牛奶、取出、倒入杯中、放回原位并关门”这类长时程任务,要求模型持续跟踪环境变化,并判断每一步操作如何影响下一步。当任务链条拉长,纯粹依赖“当前观察—下一动作”的模型更容易出现误差累积,陌生物体、位置变化或一次动作失败都可能打断整条任务链。
为应对这些局限,具身智能的“大脑”正从VLM、VLA进一步向“多模态大模型+世界模型”演化。World Model的核心任务是学习物理环境的状态转移,即理解当前世界处于什么状态,以及某个动作执行后环境可能怎样变化;WAM(World Action Model,世界动作模型)则进一步把这种预测能力与机器人动作生成结合起来,让机器人不仅知道“下一步做什么”,还能预判“动作之后世界会发生什么”。这种能力对长时程任务和异常恢复至关重要。
模型架构的变化正在传导至硬件层面。由于WAM需要更丰富的环境感知与状态预测,3D视觉、触觉、六维力传感器、灵巧手以及数据采集设备的重要性持续提升。这些硬件不仅是执行任务的工具,更是构建真实世界数据闭环的关键入口。中国供应链的优势可能因此从低成本制造进一步延伸至数据采集与闭环构建环节,从而在具身智能价值链中占据更有利的位置。
当机器人开始学习“动作之后世界会发生什么”,产业价值链将如何重新排序?这已成为具身智能领域投资者和从业者共同关注的核心问题。