2026年8月北京世界機器人大會(WRC)上,具身智慧行業的風向標發生了明顯轉向:從業者不再驚歎於機器人“像人一樣跳舞”,而是開始在心裡撥動算盤,計算投資回報率(ROI)。這場從“秀肌肉”到“翻賬本”的集體變軌,標誌著行業正式告別“表演時代”,進入“算賬時代”。
回看過去半年,這種趨勢演進頗具層次感。5月維也納ICRA上,學術界和產業界首次將火力集中在VLA(視覺-語言-動作)模型上,被視為具身智慧的“物理學補課期”;7月初上海WAIC上,200多傢俱身智慧企業同台競技,演示內容從“後空翻”換成“擰螺絲、疊衣服”,反映出行業的“場景落地焦慮期”;7月底悉尼RSS上,開源硬體、模擬工具鏈和遙操作資料方案成為主角,行業開始為“大腦聰明、身體廉價、資料貧瘠”搭建公共底座,進入“基礎設施奠基期”。而到了8月的北京WRC,所有話題都圍繞工程約束和商業底線展開,大家只盯著三個指標:多少錢?多穩?跑一個月能省幾個人的工資?
商業的歸商業:ROI成為“邏輯剎車”
在WRC現場,專業觀眾最關注的是分揀節拍最快的展台。物流分揀作為具身智慧商業化最早跑通的場景,今年競爭已從“能不能做”進化到“誰能賺到錢”。泛化性也從“學術加分項”變成了“省錢工具”。原力靈機的展台搭建了一套雙臂物流包裹分揀系統,由DM0.5泛化大模型驅動,分揀速度約2秒/件,但專業觀眾更看重“不換系統、不寫死軌跡”的能力。其聯合創始人範浩強此前向媒體解釋,泛化性等於攤薄硬體成本:同一個模型、同一套硬體,一個月內能同時支撐削黃瓜、切黃瓜、搭建積木長城、傳送帶分揀等4個場景。這種“多面手”能力在海外人力成本高、ROI容忍度窄的市場尤為關鍵,能通過減少軟體適配費用把ROI拉回正值。
另一家主打“適配能力”的自變數公司推出了WALL-B大模型,取消了“視覺、語言、動作”的三方傳話機制,將一切閉環在一個網路裡。其展示中,機器人看不見紙箱底部的面單,卻能通過箱體側面的微小凸起自主預判面單位置並原地翻面,這種“即時物理預判”被視為泛化能力的體現。
資料的歸底座:數採裝置從角落搬到C位
本屆WRC上增長最快的裝置不是機器人本體,而是資料採集裝置。一年前數採方案多藏在本體公司展台角落,今年從大廠到上游供應商幾乎都在展位正中心擺出手套、頭環和多目相機陣列。原因在於具身智慧正集體撞向“資料荒”這堵牆,“賣鏟子”的生意在2026年正式爆發。
奧比中光與螞蟻靈波的“軟硬一體”組合頗具代表性:硬體側是奧比自研的MX6800深度晶片及3D相機陣列,模型側是LingBot-Depth 2.0,目標是降低獲取3D空間資料的門檻,讓無本體數採(採集人類影片並對映到機器人)的成本跌破臨界點。他山科技則展示了觸覺感知指套,能即時捕捉接觸、受力、滑移訊號並與第一視角畫面對齊,其觀點是高質量互動資料的關鍵在於觸覺,因為視覺有欺騙性,而觸覺能幫機器人理解物體的摩擦係數和剛性。
模型企業如自變數機器人、章魚動力、釐清智慧、德塔智慧等則自研全套採集硬體,硬體設計、資料格式、標註標準全部圍繞模型訓練需求,打造完整資料閉環。光輪智慧、愷望資料、ORIGINFLOW等公司則定位為資料基礎設施提供商,擁有客戶認知、場景積累和專案交付的先發優勢。短期來看,幾類資料玩家差異化競爭格局仍將持續,但長期賽道融合與行業洗牌不可避免,因為產出低成本、高質量、多模態訓練資料需要感測硬體、場景運營、資料治理、模型訓練的全棧綜合能力。
形態的歸場景:四足已入場,人形在排隊
人形機器人依然是“明星”,但四足機器人(機器狗)和輪式機器人才是真正的“打工人”。維他動力在WRC正式推出雙足人形終端ATOM,但其核心邏輯是用消費級四足驗證產品化能力,再向人形遷移,其大頭四足產品創下近億訂單記錄。雲深處2025年行業應用收入排全球第一,展台展示的是絕影X30在瑞士高危核電站廊道執行巡檢的實戰記錄,這種“去特技化”是四足機器人成熟的標誌。智身科技則亮出單月產能突破5000台、關節模組年產能超100萬件的“暴力產能”,其銅錘M1機械臂在本體劇烈運動下仍保持末端穩定的VLA能力。璇璣動力則深耕電網、消防等垂直領域,其巡檢效率提升75%的資料頗具說服力。
四足機器人之所以先行一步,是因為其運控穩定性已通過物理世界“海試”,而人形機器人的“天塹”——本體差異帶來的資料遷移難題——正被維他動力的“具身基因組”等架構所挑戰。
感知的歸觸覺:靈巧手的“祛魅”與“增重”
靈巧手行業正從“炫技”轉向“權衡”,形成三個共識。其一,高自由度驅動路線逐漸清晰,直驅、繩驅、混驅三條路線各有擁躉:靈心巧手Linker Hand O30、曦諾未來Prima 1、強腦Revo 3、星動紀元XHAND 1-PRO走直驅;靈巧智慧DexHand021 Pro、章魚動力OctoH-Hand選擇繩驅;超維動力KAIHand、因時RH524J1則走混驅。廠商普遍多路線並押,方案沒有對錯,只看場景適配。其二,觸覺從炫技配置變成基礎能力,壓阻、電容、視觸覺、磁霍爾四類感測器並行,章魚動力整手布了1900個觸覺點,強腦Revo 3全掌都有觸覺,帕西尼自研觸覺感測器做到0.01N感知精度。觸覺資料的一致性是核心難題,資料差異過大對模型等於噪聲。其三,商業化主力並非高自由度旗艦,而是六自由度連桿手與三指手,中科矽紀今年規劃的3萬台產能主力正是這兩類產品,因為結構成熟、成本可控、可靠性高,對大多數工業場景“夠用”遠比“引數漂亮”重要。
世界模型:正在變成具身智慧的“物理編譯器”
回顧7月悉尼RSS上黃文龍和徐丹飛等人的辯論,學術界還在探討“生成不等於規劃”,爭論世界模型是否需要全量畫素生成。而到了北京WRC現場,這些討論已落地:世界模型正從一個“玄學概念”坍縮為具身智慧的“物理編譯器”。在經典計算機文明中,編譯器把人類的語義意圖翻譯成機器能讀懂的0和1;而在WRC上,世界模型在不同賽道承擔同樣角色,只是翻譯媒介是物理規律。當原力靈機讓機器人削黃瓜時,世界模型在把“削皮”這個模糊概念編譯成“力反饋、柔性形變、連桿運動”的物理指令;當智在無界把執行成本壓到150元時,是在開發更高效的“編譯器後端”;當章魚動力把預測過程視覺化時,是在展示這個“編譯器”如何即時修正物理邏輯的Bug。
具身智慧行業要的不是造出完美的、能表演後空翻的機器,而是建立一套“自動採集、自動訓練、自動進化”的編譯器閉環,人類只負責給出最高層指令,世界模型負責在腦海裡反覆試錯、校準,最終給身體下發絕對安全、絕對物理一致的程式碼。2026年是機器人從“學會動”到“學會幹活”的分水嶺,這場關於物理真理與商業邏輯的終極對齊,才剛剛跨過第一個里程碑。在這個被資料採集、算力編排和場景閉環重塑的戰場上,最後的鑰匙不在於誰的口號響,而在於誰的模型能更精準地“編譯”這個複雜的物理世界。具身智慧的“算賬時代”,才剛剛開始。