理想Foundation Model团队正式发布世界动作触觉模型ME-Dex-1.0(MachEmbodied-Dex-1.0),将触觉从辅助条件提升为未来世界中需要预测的组成部分。团队在仿真与真机平台上完成评测,RoboTwin Clean-only Avg.成功率为78.9%,领先最强对比基线7.6个百分点11项联合训练任务总体成功率65.3%,比DECO高8.9个百分点ManiFeel平均成功率70.0%,比官方基线高15.0个百分点

这一模型的核心思路,是不再把触觉仅当作当前条件输入,而是与视频共同视为需要预测的未来世界状态。给定任务指令、当前图像、本体状态和触觉观测,模型会联合去噪未来视频latent、未来触觉latent与动作序列,从而把场景变化和接触动态直接连接到机器人控制。

针对触觉数据稀缺的问题,理想构建了自主式触觉数据引擎,通过回放已有示范动作让仿真力传感器补录对齐的触觉信号,并生成执行新轨迹以扩大任务与接触模式覆盖。由于触觉数据来自异构夹爪与灵巧手,模型将真实与仿真环境的触觉数据映射到受人手结构启发的双手34区域模板,并用区域掩码区分“不可观测”与“已观测但未接触”,避免缺失值与零受力混淆。

架构上,ME-Dex-1.0采用三专家模型设计:视觉专家建模未来场景变化,触觉专家预测具有空间结构的接触动态,动作专家生成可执行动作序列。三个Transformer均采用条件Flow Matching优化,并保留独立参数与隐藏维度。跨模态交互通过H-Bridge共享注意力集中在选定中间层完成,浅层与深层保持模态专属处理,在控制计算量的同时建立协同。

评测方面,在混合训练设置下,RoboTwin加入当前触觉条件后,Random成功率由86.90%提升至89.54%;进一步加入未来触觉预测后达到90.60%;H-Bridge共享注意力最终将成功率提升至91.92%。即使将当前触觉输入置零,完整模型仍在Clean/Random上取得91.70%/91.74%,团队据此认为增益来自触觉监督与未来触觉预测,而非仅依赖当前触觉观测。

在DexJoCo的11项任务中,ME-Dex-1.0有7项排名第一,五项双臂任务平均成功率达48.8%,高于DECO与DECO.p的39.6%。在ManiFeel上,该模型在四项任务中的三项领先官方基线,其中电源插头插入成功率由58.0%提升至88.0%。定性分析显示,该模型能在两个基线模型失败的情况下完成抽屉放置和物体扫描任务,并在插销装配与iPad密码输入任务上展现更有效的双手协同。

真机部署覆盖LeRobot SO-101 PX夹爪与Xynova Flex2灵巧手。演示视频中,搭载该模型的Xynova Flex2先扭转手腕按压抽纸一侧使其翘起,再完成抓取并投入方盒,触觉图随操作呈现区域数值变化;LeRobot SO-101 PX夹取药瓶的流程则停顿较多,视频标注为五倍速播放。

团队还披露了下一阶段方向:扩大跨平台触觉预训练,评估模型对未知传感布局与机器人本体的泛化能力;研究触觉驱动的局部反馈控制,通过执行过程中的高频修正提升精细操作的响应速度与准确性。

从产业视角看,过去两年VLA模型让机器人“看懂”了世界,但操作成败往往藏在指尖。ME-Dex-1.0验证了未来触觉同样可预测、且预测的是接触动态如何连接到下一步动作这一路径。不过,触觉预训练规模、跨平台泛化与真机实时性仍是待解问题。具身大模型的竞争正从视觉与语言延伸至接触感知,让模型主动预测接触而非被动接收触觉,可能成为下一代世界-动作模型的重要方向。