在2025年世界人工智能大会(WAIC)上,具身智能的数据瓶颈成为最受关注的议题之一。亮源新创创始人姜旭在主论坛对话中直言,具身智能本质是大模型向物理世界的延伸,其发展将沿“规模化预训练→规模化对齐→规模化部署”三阶段演进,而当前行业连最基础的预训练阶段数据缺口都未填上。这一判断引发广泛共鸣,但如何解决数据问题,论坛嘉宾并未给出详细解答。

雷峰网AI科技评论走访WAIC上的具身智能企业后发现,今年参展的具身数据基建公司数量显著增加,其中简智机器人提出的“Model-Ready Data”(开箱即用数据)概念,为行业提供了清晰的解决路径。简智机器人认为,当前互联网沉淀的百亿小时人类视频只能支撑模型“看懂世界”,无法支持机器人完成精准物理交互。真正需要的数据必须同时具备三个核心特征:高精度多模态多样性

高精度是基础门槛。行业普通方案的手部关节追踪误差普遍在2-3厘米,相当于成年人手指直径,导致模型学到错误因果关系。简智通过端到端自研算法和多源传感器融合,将手部关节追踪稳定误差降至亚厘米级(小于1厘米),成为行业首个实现该精度的无本体采集方案。多模态则依赖硬件能力,简智采用六目同步相机,不仅向外拍摄环境,还向内覆盖腿、膝盖、腰部动作,同时通过电子皮肤+仿生关节直接测量抓握力度、接触面积和摩擦力,补足触觉模态。多样性方面,简智自研DPH指标,量化“同一技能下每小时数据由多少人、在多少场景下完成”,确保数据来源的丰富性。

在算法层面,简智构建了完整的Data Foundation Model(DFM数据基础模型),实现端到端数据处理。其核心应用是视频生成模型补全关键帧,当手部被物体遮挡时,模型基于前后帧信息预测被遮挡部分的手部姿态,将无效帧比例控制在3%以内。此外,自研感知压缩算法将六目相机原始数据压缩至2%,并在设备端完成端侧质检,直接过滤30%的无效数据,大幅降低传输和存储成本。

硬件设计上,简智坚持全链路自研,从摄像头、关节传感器到计算单元、电池管理和热管理均自主开发,团队包含大量消费电子行业资深工程师,设计之初就考虑百台、千台甚至万台规模量产的一致性。其无本体采集方案从设计之初就面向人形机器人终极需求,完整覆盖腰、腿、全身运动链,输出SMPL-X人体网格,还原人做动作时的全身协同、重心变化和平衡逻辑。

场景多样性方面,简智针对专业场景(如实验室、高精尖制造、化工)和商业场景(如厨师、理发师)的采集需求,通过极致轻量化和无感化设计,确保不干扰专业人士的正常操作。其数据交付采用流式交付模式,客户无需等待硬盘邮寄,可直接在自己的服务器上按需调取数据集,甚至对接训练流水线。

作为第三方数据基础设施厂商,简智明确业务边界:不做与客户绑定的真机数据(头部厂商会自己做),不做具身基座模型,不做机器人本体,只专注数据这一件事。这种中立性已获得大厂客户认可,目前简智正助力小米蚂蚁灵波等头部模型公司。

从WAIC现场反馈看,具身智能正从“拼参数、拼Demo”进入“拼落地、拼工业化能力”的新阶段。数据基础设施的重要性才刚刚被行业认识,未来百万小时甚至上亿小时的真实场景数据,才可能触发模型能力的涌现。