8月3日,自變數機器人與北京理工大學、清華大學聯合釋出並開源了HOST框架(Human-to-robot One-Shot Skill AcquisiTion,人類到機器人單樣本技能獲取)。這一框架讓機器人只需觀看一段平均時長29秒的人類演示影片,就能在不更新模型引數、不採集新資料的情況下執行全新任務。在涵蓋放水果、堆碗、擦盤子、插筆等50項訓練階段從未見過的桌面操作任務測試中,HOST的技能復現成功率達到62%。相關論文已發表在arXiv上(編號2607.20033)。
長期以來,教機器人學會新技能通常需要專業工程師使用昂貴的遙操作裝置採集數百條演示資料,再花費數小時微調模型引數,且容易導致機器人“學新忘舊”。HOST的突破在於將學習範式從“動作模仿”轉向“結果推理”:機器人不再試圖模仿人類的肢體動作,而是觀察人類完成任務後的結果狀態,再反推自己需要執行的行動序列。這一思路繞開了人機身體結構差異這一難題,將學習目標從“復現過程”重新定義為“達成結果”。
HOST的處理流程分為三步:任務階段判斷、視角遷移和動作反推。首先,機器人觀看人類影片時判斷當前任務進行到哪一階段;其次,將人類執行完動作後的畫面轉化為機器人自身視角和身體結構下的畫面;最後,從目標畫面反推需要執行的動作序列並執行。這種“先想象結果,再反推動作”的機制賦予了HOST較強的泛化能力,即使執行過程中物品位置被移動,機器人也能根據目標狀態重新規劃動作。
針對人類與機器人執行速度不同步的問題,HOST採用“按任務進度對齊”策略,通過動態時間規整演算法自動建立人類影片幀與機器人操作步驟之間的對應關係。論文資料顯示,該方法將對齊誤差從基於時鐘時間對齊的0.079降至0.006(平均絕對進度差),降低了一個數量級。這意味著普通人無需刻意放慢動作或標準化流程,隨手拍攝的影片即可作為教學素材。
HOST的技術底座是一個帶有視覺預測功能的級聯策略模型,採用“雙專家混合架構”。其訓練分為兩個階段:首先在193,462條機器人同體軌跡資料上預訓練,覆蓋229項任務;隨後使用5,847條人類-機器人配對演示資料進行微調,實現跨本體遷移。由於推理時不修改模型引數,新技能以推理時輸入的形式存在,舊技能以模型權重形式存在,兩者互不干擾,因此HOST幾乎完整保留了已掌握的技能。論文資料顯示,在微調方案學習新技能後,最強基線模型(Wall-OSS+SFT)在舊任務上的表現下降至原來的43%,而HOST幾乎不受影響。
HOST的論文、程式碼和模型權重已全部開源至GitHub和Hugging Face。研究團隊表示,開源的目的是將機器人技能獲取從依賴專業人員採集資料、反覆訓練的專業流程,轉變為普通人通過一段影片即可完成教學的方式。這一目標直指具身智慧行業的核心瓶頸——資料獲取成本。目前,頭部玩家多走大規模資料採集路線,但遙操作資料採集成本高昂,且長尾場景覆蓋不足。HOST提供了一條不同路徑:不追求資料規模無限擴張,而是通過演算法創新降低單次學習的門檻。
當然,HOST並非沒有侷限。62%的成功率在單樣本學習場景下已屬突破性成果,但意味著在近四成場景下機器人仍會失敗,距離可靠部署還有差距。目前測試的50項任務以桌面操作類為主,在更復雜的動態場景中表現尚待驗證。研究團隊在專案主頁表示:“HOST是邁向通用機器人學習的第一步,我們希望社群能在此基礎上走得更遠。”
值得注意的是,2026年以來,具身智慧領域呈現開源加速趨勢,從谷歌的Open X-Embodiment到小米的Xiaomi-Robotics-1,行業正從“閉門造車”轉向“共建生態”。自變數團隊選擇在專案之初就全面開源,順應了這一趨勢。在Scaling Law仍主導AI敘事的今天,HOST證明了演算法創新同樣可以大幅降低資料依賴,這或許為具身智慧行業提供了一個值得深思的方向:與其無限堆資料,不如教會機器人如何更聰明地學習。