大型語言模型通過在海量資料上預訓練獲得通用能力,但機器人領域至今仍未找到類似的成功配方。中國具身智慧公司 X Square Robot 對此給出了一個明確的答案:構建一套從資料、世界模型到行動模型的整合基礎棧,並主張以開放的方式開發和釋出。
這套技術棧並非依賴單一超大模型,而是由幾個關鍵原則串聯。首先,機器人資料的基本單元是“互動”而非“軌跡”——一次演示只有在確實按意圖改變了物理世界時才算成功,而不僅僅是關節動了。其次,預訓練應直接產生可用的能力,而非僅為後續微調做初始化。第三,行為建模應圍繞物理事件展開,而非固定的時間片段。
在資料層面,X Square Robot 認為制約通用機器人的最大瓶頸是互動資料的成本與質量,而非模型引數量。為此,該公司開發了名為 QUANXTA Zero 系列 的通用操作介面資料採集系統。該系統讓操作員穿戴帶有雙夾爪的裝置進行演示,而非直接遙操作機器人。其最顯著的特點是嚴格的質量控制閉環:系統會將錄製的軌跡在真實機器人上回放,只有那些實際完成任務的軌跡才會被標記為有效。例如,一個夾爪若過早閉合,在資料中看似完成抓取,實則已將物體推開,這類資料便會被剔除。公司認為,一個較小的乾淨資料集,價值可能超過一個更大的噪聲資料集。
此外,該公司將低成本的人類演示資料與稀缺的真實機器人資料結合使用。先在大量無機器人參與的人類演示資料上預訓練以構建通用表徵,再加入少量真實機器人資料作為錨點,以適配特定機器的動力學特性。X Square Robot 報告稱,這種方法在效能上可與完全使用機器人資料集的方案相媲美,但資料採集成本降低了約 20 倍,這主要得益於可穿戴裝置遠比遙操作設定便宜。
在模型架構上,X Square Robot 開發了名為 WALL-WM 的世界模型,其設計思路與主流方案不同。多數行動模型根據當前影像和指令預測固定時長的運動片段,這導致行為邊界由時間決定,而非動作本身的起止。WALL-WM 則將基於動作的語義事件作為基本單元,例如“伸手”、“抓取”、“放置”等——這些事件既可以用語言描述,也能在影片中觀測,並可執行成運動。
WALL-WM 的設計還體現了對保留大型影片模型已有知識的考量。它將一個文本生成影片的模型與一個新初始化的行動網路耦合,行動網路從影片特徵中讀取資訊而不覆蓋它們,從而保留了視覺先驗。該模型提供兩種模式:事件模式以可變長度片段執行,適合長程推理;固定長度模式則產生控制器所需的穩定即時輸出。這使得 WALL-WM 介於主流的固定片段行動模型與純粹的影片世界模型之間,既保持了世界模型的預測特性,又能產生可執行的控制指令。
X Square Robot 的這套方案為具身智慧領域提供了一個清晰且可檢驗的技術假設。其強調資料質量、事件驅動建模以及多模型協同的思路,若能在更廣泛的第三方測試中得到驗證,或將推動機器人學習從特定任務的定製化開發,邁向更具通用性的基礎模型時代。不過,目前其最有力的實驗結果仍基於公司自身的機器人與資料採集流程,未來在更多樣化場景下的獨立評估將至關重要。