理想Foundation Model團隊正式釋出世界動作觸覺模型ME-Dex-1.0(MachEmbodied-Dex-1.0),將觸覺從輔助條件提升為未來世界中需要預測的組成部分。團隊在模擬與真機平台上完成評測,RoboTwin Clean-only Avg.成功率為78.9%,領先最強對比基線7.6個百分點;11項聯合訓練任務總體成功率65.3%,比DECO高8.9個百分點;ManiFeel平均成功率70.0%,比官方基線高15.0個百分點。
這一模型的核心思路,是不再把觸覺僅當作當前條件輸入,而是與影片共同視為需要預測的未來世界狀態。給定任務指令、當前影像、本體狀態和觸覺觀測,模型會聯合去噪未來影片latent、未來觸覺latent與動作序列,從而把場景變化和接觸動態直接連線到機器人控制。
針對觸覺資料稀缺的問題,理想構建了自主式觸覺資料引擎,通過回放已有示範動作讓模擬力感測器補錄對齊的觸覺訊號,並生成執行新軌跡以擴大任務與接觸模式覆蓋。由於觸覺資料來自異構夾爪與靈巧手,模型將真實與模擬環境的觸覺資料對映到受人手結構啟發的雙手34區域模板,並用區域掩碼區分“不可觀測”與“已觀測但未接觸”,避免缺失值與零受力混淆。
架構上,ME-Dex-1.0採用三專家模型設計:視覺專家建模未來場景變化,觸覺專家預測具有空間結構的接觸動態,動作專家生成可執行動作序列。三個Transformer均採用條件Flow Matching最佳化,並保留獨立引數與隱藏維度。跨模態互動通過H-Bridge共享注意力集中在選定中間層完成,淺層與深層保持模態專屬處理,在控制計算量的同時建立協同。
評測方面,在混合訓練設定下,RoboTwin加入當前觸覺條件後,Random成功率由86.90%提升至89.54%;進一步加入未來觸覺預測後達到90.60%;H-Bridge共享注意力最終將成功率提升至91.92%。即使將當前觸覺輸入置零,完整模型仍在Clean/Random上取得91.70%/91.74%,團隊據此認為增益來自觸覺監督與未來觸覺預測,而非僅依賴當前觸覺觀測。
在DexJoCo的11項任務中,ME-Dex-1.0有7項排名第一,五項雙臂任務平均成功率達48.8%,高於DECO與DECO.p的39.6%。在ManiFeel上,該模型在四項任務中的三項領先官方基線,其中電源插頭插入成功率由58.0%提升至88.0%。定性分析顯示,該模型能在兩個基線模型失敗的情況下完成抽屜放置和物體掃描任務,並在插銷裝配與iPad密碼輸入任務上展現更有效的雙手協同。
真機部署覆蓋LeRobot SO-101 PX夾爪與Xynova Flex2靈巧手。演示影片中,搭載該模型的Xynova Flex2先扭轉手腕按壓抽紙一側使其翹起,再完成抓取並投入方盒,觸覺圖隨操作呈現區域數值變化;LeRobot SO-101 PX夾取藥瓶的流程則停頓較多,影片標註為五倍速播放。
團隊還披露了下一階段方向:擴大跨平台觸覺預訓練,評估模型對未知感測佈局與機器人本體的泛化能力;研究觸覺驅動的區域性反饋控制,通過執行過程中的高頻修正提升精細操作的響應速度與準確性。
從產業視角看,過去兩年VLA模型讓機器人“看懂”了世界,但操作成敗往往藏在指尖。ME-Dex-1.0驗證了未來觸覺同樣可預測、且預測的是接觸動態如何連線到下一步動作這一路徑。不過,觸覺預訓練規模、跨平台泛化與真機即時性仍是待解問題。具身大模型的競爭正從視覺與語言延伸至接觸感知,讓模型主動預測接觸而非被動接收觸覺,可能成為下一代世界-動作模型的重要方向。