虎嗅黃青春頻道發表深度分析文章指出,外界對騰訊在AI賽道“起大早趕晚集”的揶揄,可能低估了其實際佈局。文章梳理了騰訊從底層混元大模型,到中間層智慧體開發平台ADP、具身智慧平台Tairos,再到應用層WorkBuddy、CodeBuddy等產品的全棧路徑,認為其底層技術到終端應用的落地脈絡清晰。
在具身智慧這一向物理世界延伸的“戰略要塞”上,騰訊由首席科學家、Robotics X實驗室主任、福田實驗室主任張正友帶隊,選擇了一條與行業主流“端到端單模型”截然不同的技術路線。張正友以神經科學的“裂腦實驗”指出,當前多數具身方案過度依賴語言模型邏輯,但語言不等於完整認知,真正的智慧必須在“感知、決策、行動”的閉環中形成。基於此,騰訊構建了三層異構的具身智慧架構Apexio:最上層為認知系統,呼叫大模型進行深度推理與任務規劃;中間層為感知行動系統,接收視覺等環境資訊並快速調整行為;最底層為反射系統,以更高頻率執行,處理碰撞、失衡等突發狀況,實現即時自保。文章認為,這種分層架構避免了單一端到端模型在推理延遲與深度能力之間的兩難,更貼合物理世界執行規律。
在具體模型落地方面,騰訊釋出的RxBrain(具身世界認知基座模型)實現了語言拆解與目標影像生成的打通。自研的HyVLA-0.5模型已實現工業級落地,依託自研亞毫米級UMI穿戴式資料採集手套,積累了超過1萬小時的人類第一視角操作資料。該模型已在日化品工廠產線完成實測,作業成功率超過95%,新增品類(SKU)適配週期不到3天。在權威模擬評測中,HyVLA-0.5也拿下綜合排名第一,並在長時序任務、記憶任務兩個維度登頂。
對於外界關於騰訊不做機器人硬體的質疑,張正友以手機行業格局類比:騰訊選擇的是類似安卓的底層系統賦能模式,而非蘋果式的軟硬體全閉環。他認為中國機器人本體制造能力已高度成熟,騰訊的核心優勢在於AI、雲與連線能力,因此Tairos定位為具身智慧的“通用大腦”,向上支撐應用開發商,向下賦能機器人本體廠商。據文章透露,Tairos與宇樹打磨導覽場景時,基礎適配曾耗時三個月,但依託標準化介面後,新增場景5天即可落地;給越疆機器狗做系統適配更是隻用一天就完成部署。騰訊優先繫結越疆、宇樹、智元等頭部本體廠商,旨在跑通標杆場景後快速複製。
文章還指出,具身智慧的核心瓶頸仍是資料。騰訊的思路是打通四層資料體系,用底層大規模資料做預訓練,用頂層高精度資料做微調。算力層面,騰訊雲異構計算研發總監陳煜東透露,具身智慧客戶的算力需求年增速達200%-300%,訓練規模從百卡級躍升至千卡、萬卡級。針對國產晶片適配難題,團隊已通過AI Agent輔助運算元遷移,將單個運算元遷移時間從平均5天縮短至1天。
對於行業同質化競爭,張正友認為這是早期正常狀態,規模化落地尚未啟動。在落地節奏上,他認為工業場景會率先實現規模化落地,因為環境結構化、任務標準化;而家庭、養老等非結構化場景門檻更高,核心是安全性必須做到100%,需要觸覺、力覺感知等必備能力。文章總結認為,騰訊在AI時代的目標是成為連線模型與場景、智慧與硬體的“水電煤”式基建。