2026年8月北京世界机器人大会(WRC)上,具身智能行业的风向标发生了明显转向:从业者不再惊叹于机器人“像人一样跳舞”,而是开始在心里拨动算盘,计算投资回报率(ROI)。这场从“秀肌肉”到“翻账本”的集体变轨,标志着行业正式告别“表演时代”,进入“算账时代”。
回看过去半年,这种趋势演进颇具层次感。5月维也纳ICRA上,学术界和产业界首次将火力集中在VLA(视觉-语言-动作)模型上,被视为具身智能的“物理学补课期”;7月初上海WAIC上,200多家具身智能企业同台竞技,演示内容从“后空翻”换成“拧螺丝、叠衣服”,反映出行业的“场景落地焦虑期”;7月底悉尼RSS上,开源硬件、仿真工具链和遥操作数据方案成为主角,行业开始为“大脑聪明、身体廉价、数据贫瘠”搭建公共底座,进入“基础设施奠基期”。而到了8月的北京WRC,所有话题都围绕工程约束和商业底线展开,大家只盯着三个指标:多少钱?多稳?跑一个月能省几个人的工资?
商业的归商业:ROI成为“逻辑刹车”
在WRC现场,专业观众最关注的是分拣节拍最快的展台。物流分拣作为具身智能商业化最早跑通的场景,今年竞争已从“能不能做”进化到“谁能赚到钱”。泛化性也从“学术加分项”变成了“省钱工具”。原力灵机的展台搭建了一套双臂物流包裹分拣系统,由DM0.5泛化大模型驱动,分拣速度约2秒/件,但专业观众更看重“不换系统、不写死轨迹”的能力。其联合创始人范浩强此前向媒体解释,泛化性等于摊薄硬件成本:同一个模型、同一套硬件,一个月内能同时支撑削黄瓜、切黄瓜、搭建积木长城、传送带分拣等4个场景。这种“多面手”能力在海外人力成本高、ROI容忍度窄的市场尤为关键,能通过减少软件适配费用把ROI拉回正值。
另一家主打“适配能力”的自变量公司推出了WALL-B大模型,取消了“视觉、语言、动作”的三方传话机制,将一切闭环在一个网络里。其展示中,机器人看不见纸箱底部的面单,却能通过箱体侧面的微小凸起自主预判面单位置并原地翻面,这种“实时物理预判”被视为泛化能力的体现。
数据的归底座:数采设备从角落搬到C位
本届WRC上增长最快的设备不是机器人本体,而是数据采集设备。一年前数采方案多藏在本体公司展台角落,今年从大厂到上游供应商几乎都在展位正中心摆出手套、头环和多目相机阵列。原因在于具身智能正集体撞向“数据荒”这堵墙,“卖铲子”的生意在2026年正式爆发。
奥比中光与蚂蚁灵波的“软硬一体”组合颇具代表性:硬件侧是奥比自研的MX6800深度芯片及3D相机阵列,模型侧是LingBot-Depth 2.0,目标是降低获取3D空间数据的门槛,让无本体数采(采集人类视频并映射到机器人)的成本跌破临界点。他山科技则展示了触觉感知指套,能实时捕捉接触、受力、滑移信号并与第一视角画面对齐,其观点是高质量交互数据的关键在于触觉,因为视觉有欺骗性,而触觉能帮机器人理解物体的摩擦系数和刚性。
模型企业如自变量机器人、章鱼动力、厘清智能、德塔智能等则自研全套采集硬件,硬件设计、数据格式、标注标准全部围绕模型训练需求,打造完整数据闭环。光轮智能、恺望数据、ORIGINFLOW等公司则定位为数据基础设施提供商,拥有客户认知、场景积累和项目交付的先发优势。短期来看,几类数据玩家差异化竞争格局仍将持续,但长期赛道融合与行业洗牌不可避免,因为产出低成本、高质量、多模态训练数据需要传感硬件、场景运营、数据治理、模型训练的全栈综合能力。
形态的归场景:四足已入场,人形在排队
人形机器人依然是“明星”,但四足机器人(机器狗)和轮式机器人才是真正的“打工人”。维他动力在WRC正式推出双足人形终端ATOM,但其核心逻辑是用消费级四足验证产品化能力,再向人形迁移,其大头四足产品创下近亿订单记录。云深处2025年行业应用收入排全球第一,展台展示的是绝影X30在瑞士高危核电站廊道执行巡检的实战记录,这种“去特技化”是四足机器人成熟的标志。智身科技则亮出单月产能突破5000台、关节模组年产能超100万件的“暴力产能”,其铜锤M1机械臂在本体剧烈运动下仍保持末端稳定的VLA能力。璇玑动力则深耕电网、消防等垂直领域,其巡检效率提升75%的数据颇具说服力。
四足机器人之所以先行一步,是因为其运控稳定性已通过物理世界“海试”,而人形机器人的“天堑”——本体差异带来的数据迁移难题——正被维他动力的“具身基因组”等架构所挑战。
感知的归触觉:灵巧手的“祛魅”与“增重”
灵巧手行业正从“炫技”转向“权衡”,形成三个共识。其一,高自由度驱动路线逐渐清晰,直驱、绳驱、混驱三条路线各有拥趸:灵心巧手Linker Hand O30、曦诺未来Prima 1、强脑Revo 3、星动纪元XHAND 1-PRO走直驱;灵巧智能DexHand021 Pro、章鱼动力OctoH-Hand选择绳驱;超维动力KAIHand、因时RH524J1则走混驱。厂商普遍多路线并押,方案没有对错,只看场景适配。其二,触觉从炫技配置变成基础能力,压阻、电容、视触觉、磁霍尔四类传感器并行,章鱼动力整手布了1900个触觉点,强脑Revo 3全掌都有触觉,帕西尼自研触觉传感器做到0.01N感知精度。触觉数据的一致性是核心难题,数据差异过大对模型等于噪声。其三,商业化主力并非高自由度旗舰,而是六自由度连杆手与三指手,中科硅纪今年规划的3万台产能主力正是这两类产品,因为结构成熟、成本可控、可靠性高,对大多数工业场景“够用”远比“参数漂亮”重要。
世界模型:正在变成具身智能的“物理编译器”
回顾7月悉尼RSS上黄文龙和徐丹飞等人的辩论,学术界还在探讨“生成不等于规划”,争论世界模型是否需要全量像素生成。而到了北京WRC现场,这些讨论已落地:世界模型正从一个“玄学概念”坍缩为具身智能的“物理编译器”。在经典计算机文明中,编译器把人类的语义意图翻译成机器能读懂的0和1;而在WRC上,世界模型在不同赛道承担同样角色,只是翻译媒介是物理规律。当原力灵机让机器人削黄瓜时,世界模型在把“削皮”这个模糊概念编译成“力反馈、柔性形变、连杆运动”的物理指令;当智在无界把运行成本压到150元时,是在开发更高效的“编译器后端”;当章鱼动力把预测过程可视化时,是在展示这个“编译器”如何实时修正物理逻辑的Bug。
具身智能行业要的不是造出完美的、能表演后空翻的机器,而是建立一套“自动采集、自动训练、自动进化”的编译器闭环,人类只负责给出最高层指令,世界模型负责在脑海里反复试错、校准,最终给身体下发绝对安全、绝对物理一致的代码。2026年是机器人从“学会动”到“学会干活”的分水岭,这场关于物理真理与商业逻辑的终极对齐,才刚刚跨过第一个里程碑。在这个被数据采集、算力编排和场景闭环重塑的战场上,最后的钥匙不在于谁的口号响,而在于谁的模型能更精准地“编译”这个复杂的物理世界。具身智能的“算账时代”,才刚刚开始。