在2025年世界人工智慧大會(WAIC)上,具身智慧的資料瓶頸成為最受關注的議題之一。亮源新創創始人姜旭在主論壇對話中直言,具身智慧本質是大模型向物理世界的延伸,其發展將沿“規模化預訓練→規模化對齊→規模化部署”三階段演進,而當前行業連最基礎的預訓練階段資料缺口都未填上。這一判斷引發廣泛共鳴,但如何解決資料問題,論壇嘉賓並未給出詳細解答。

雷峰網AI科技評論走訪WAIC上的具身智慧企業後發現,今年參展的具身資料基建公司數量顯著增加,其中簡智機器人提出的“Model-Ready Data”(開箱即用資料)概念,為行業提供了清晰的解決路徑。簡智機器人認為,當前網際網路沉澱的百億小時人類影片只能支撐模型“看懂世界”,無法支援機器人完成精準物理互動。真正需要的資料必須同時具備三個核心特徵:高精度多模態多樣性

高精度是基礎門檻。行業普通方案的手部關節追蹤誤差普遍在2-3釐米,相當於成年人手指直徑,導致模型學到錯誤因果關係。簡智通過端到端自研演算法和多源感測器融合,將手部關節追蹤穩定誤差降至亞釐米級(小於1釐米),成為行業首個實現該精度的無本體採集方案。多模態則依賴硬體能力,簡智採用六目同步相機,不僅向外拍攝環境,還向內覆蓋腿、膝蓋、腰部動作,同時通過電子皮膚+仿生關節直接測量抓握力度、接觸面積和摩擦力,補足觸覺模態。多樣性方面,簡智自研DPH指標,量化“同一技能下每小時資料由多少人、在多少場景下完成”,確保資料來源的豐富性。

在演算法層面,簡智構建了完整的Data Foundation Model(DFM資料基礎模型),實現端到端資料處理。其核心應用是影片生成模型補全關鍵幀,當手部被物體遮擋時,模型基於前後幀資訊預測被遮擋部分的手部姿態,將無效幀比例控制在3%以內。此外,自研感知壓縮演算法將六目相機原始資料壓縮至2%,並在裝置端完成端側質檢,直接過濾30%的無效資料,大幅降低傳輸和儲存成本。

硬體設計上,簡智堅持全鏈路自研,從攝像頭、關節感測器到計算單元、電池管理和熱管理均自主開發,團隊包含大量消費電子行業資深工程師,設計之初就考慮百台、千台甚至萬台規模量產的一致性。其無本體採集方案從設計之初就面向人形機器人終極需求,完整覆蓋腰、腿、全身運動鏈,輸出SMPL-X人體網格,還原人做動作時的全身協同、重心變化和平衡邏輯。

場景多樣性方面,簡智針對專業場景(如實驗室、高精尖製造、化工)和商業場景(如廚師、理髮師)的採集需求,通過極致輕量化和無感化設計,確保不干擾專業人士的正常操作。其資料交付採用流式交付模式,客戶無需等待硬碟郵寄,可直接在自己的伺服器上按需調取資料集,甚至對接訓練流水線。

作為第三方資料基礎設施廠商,簡智明確業務邊界:不做與客戶繫結的真機資料(頭部廠商會自己做),不做具身基座模型,不做機器人本體,只專注資料這一件事。這種中立性已獲得大廠客戶認可,目前簡智正助力小米螞蟻靈波等頭部模型公司。

從WAIC現場反饋看,具身智慧正從“拼引數、拼Demo”進入“拼落地、拼工業化能力”的新階段。資料基礎設施的重要性才剛剛被行業認識,未來百萬小時甚至上億小時的真實場景資料,才可能觸發模型能力的湧現。