在2026世界人工智能大会(WAIC)上,具身智能成为最热门的赛道之一,各厂商纷纷展示机器人产品。然而,腾讯首席科学家、腾讯Robotics X实验室福田实验室主任张正友在媒体交流会上直言,具身智能仍处于起步阶段,真正的落地应用较少,行业在场景选择和本体形态上存在明显的同质化现象。

张正友表示,大家都在寻找能真正发挥具身智能作用的场景,最终找到的可能都差不多。但他认为这不一定是坏事,任何行业起步时都有大量企业涌入,后续会经历大浪淘沙,这不会阻碍行业发展。他多次提到养老场景是具身智能的重要落地方向,但也承认这是最难的应用场景之一。

针对当前备受关注的超仿生人形机器人,张正友明确表示腾讯没有涉足这一领域。他认为,提供情绪价值不一定需要通过超仿生的方式,而应从第一性原理出发思考问题。这与腾讯在具身智能领域的整体战略一致——2025年初,腾讯董事会主席兼首席执行官马化腾曾表示,腾讯希望成为所有机器人厂商的合作伙伴,而非取而代之做硬件。

正是在这一背景下,腾讯在2026 WAIC期间正式发布了具身智能开放平台Tairos(“钛螺丝”)。这是国内首个以模块化方式提供大模型、开发工具和数据服务的具身智能软件平台,通过即插即用的方式面向机器人行业开放。过去一年,腾讯Robotics X实验室已与宇树智元、越疆、松延动力、乐聚、华沿等机器人企业,以及博世、蓝思、景德镇、敦煌等场景合作伙伴,探索具身智能在不同机器人和产业场景中的落地。

同时,腾讯还推出了具身智能系列新模型和智能体新成果,首次系统性地打通“感知—身体—行动”的闭环。本次发布的具身基座模型包括Hy-Embodied-VLM-1.0Hy-Embodied-RxBrain-1.0Hy-Embodied-VLA-0.5,均基于混元大模型打造。张正友解释,VLM模型像“右脑”,负责理解图像、空间和场景;RxBrain模型像具身“大脑”,统一认知、规划和对未来状态的想象;VLA模型连接“小脑”和身体,把高层目标转化成连续的、可纠错的动作。

其中,Hy-Embodied-VLA-0.5的核心竞争力并非训练一个更大的模型,而是构建“数据—模型—训练—部署”协同发力的完整学习栈,通过亚毫米级高精度UMI采集系统积累超一万小时人类示教数据。张正友指出,真正的智能需要让语言、视觉、空间认知、身体控制和环境反馈连通起来,在“感知—身体—行动”的闭环里接受验证。

张正友认为,当前最聪明的人工智能本质上仍是“缸中之脑”。大模型进展令人惊叹,但一旦进入真实世界,问题就出现了:它未必真正理解物体的位置、空间关系和可操作性,也很难在持续变化的环境中一边行动、一边接收反馈并及时调整。这就像是一个被养在缸里的大脑——拥有丰富知识,却没有身体,缺少和世界直接互动的闭环,他把这种状态称为“离身智能”。

具身智能数据稀缺是阻碍其发展的关键因素。张正友指出,在具身智能数字金字塔中,最底层是互联网数据,上一层是第一人称视角操作视频,再上一层是带传感器手套收集的数据,最顶层是遥操作数据。遥操作数据采集效率低,但被视作训练机器人效果最好的数据。要让机器人变得更智能,这四类数据需要打通。

大语言模型技术栈已收敛到大家公认的范畴不同,张正友表示,具身智能模型的技术方案尚未达成共识。去年业界兴起VLA(视觉语言动作模型)范式,今年则在谈论世界模型,Hy-Embodied-RxBrain-1.0就是腾讯在世界理解模型上的探索。