在2026世界人工智慧大會(WAIC)上,具身智慧成為最熱門的賽道之一,各廠商紛紛展示機器人產品。然而,騰訊首席科學家、騰訊Robotics X實驗室及福田實驗室主任張正友在媒體交流會上直言,具身智慧仍處於起步階段,真正的落地應用較少,行業在場景選擇和本體形態上存在明顯的同質化現象。
張正友表示,大家都在尋找能真正發揮具身智慧作用的場景,最終找到的可能都差不多。但他認為這不一定是壞事,任何行業起步時都有大量企業湧入,後續會經歷大浪淘沙,這不會阻礙行業發展。他多次提到養老場景是具身智慧的重要落地方向,但也承認這是最難的應用場景之一。
針對當前備受關注的超仿生人形機器人,張正友明確表示騰訊沒有涉足這一領域。他認為,提供情緒價值不一定需要通過超仿生的方式,而應從第一性原理出發思考問題。這與騰訊在具身智慧領域的整體戰略一致——2025年初,騰訊董事會主席兼執行長馬化騰曾表示,騰訊希望成為所有機器人廠商的合作伙伴,而非取而代之做硬體。
正是在這一背景下,騰訊在2026 WAIC期間正式釋出了具身智慧開放平台Tairos(“鈦螺絲”)。這是國內首個以模組化方式提供大模型、開發工具和資料服務的具身智慧軟體平台,通過即插即用的方式面向機器人行業開放。過去一年,騰訊Robotics X實驗室已與宇樹、智元、越疆、松延動力、樂聚、華沿等機器人企業,以及博世、藍思、景德鎮、敦煌等場景合作伙伴,探索具身智慧在不同機器人和產業場景中的落地。
同時,騰訊還推出了具身智慧系列新模型和智慧體新成果,首次系統性地打通“感知—身體—行動”的閉環。本次釋出的具身基座模型包括Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0和Hy-Embodied-VLA-0.5,均基於混元大模型打造。張正友解釋,VLM模型像“右腦”,負責理解影像、空間和場景;RxBrain模型像具身“大腦”,統一認知、規劃和對未來狀態的想象;VLA模型連線“小腦”和身體,把高層目標轉化成連續的、可糾錯的動作。
其中,Hy-Embodied-VLA-0.5的核心競爭力並非訓練一個更大的模型,而是構建“資料—模型—訓練—部署”協同發力的完整學習棧,通過亞毫米級高精度UMI採集系統積累超一萬小時人類示教資料。張正友指出,真正的智慧需要讓語言、視覺、空間認知、身體控制和環境反饋連通起來,在“感知—身體—行動”的閉環裡接受驗證。
張正友認為,當前最聰明的人工智慧本質上仍是“缸中之腦”。大模型進展令人驚歎,但一旦進入真實世界,問題就出現了:它未必真正理解物體的位置、空間關係和可操作性,也很難在持續變化的環境中一邊行動、一邊接收反饋並及時調整。這就像是一個被養在缸裡的大腦——擁有豐富知識,卻沒有身體,缺少和世界直接互動的閉環,他把這種狀態稱為“離身智慧”。
具身智慧資料稀缺是阻礙其發展的關鍵因素。張正友指出,在具身智慧數字金字塔中,最底層是網際網路資料,上一層是第一人稱視角操作影片,再上一層是帶感測器手套收集的資料,最頂層是遙操作資料。遙操作資料採集效率低,但被視作訓練機器人效果最好的資料。要讓機器人變得更智慧,這四類資料需要打通。
與大語言模型技術棧已收斂到大家公認的範疇不同,張正友表示,具身智慧模型的技術方案尚未達成共識。去年業界興起VLA(視覺語言動作模型)範式,今年則在談論世界模型,Hy-Embodied-RxBrain-1.0就是騰訊在世界理解模型上的探索。