一篇由李飛飛、Yilun Du 等十餘位頂尖學者聯合署名的論文《Masked Visual Actions for Unified World Modeling》近日在 arXiv 上公開,迅速引發關注。論文提出一種名為 MVA 的方法,通過將機器人動作轉化為畫素遮罩軌跡,讓機器人直接利用現成的影片生成模型,而無需訓練專屬的機器人大模型。這一思路可能為具身智慧領域帶來範式轉變。

論文的署名陣容堪稱豪華,包括 ImageNet 締造者、如今專注空間智慧的李飛飛,斯坦福助理教授、物理推理方向代表人物吳佳俊,ControlNet 作者張呂民,斯坦福計算成像實驗室負責人 Gordon Wetzstein,以及機器人基礎模型核心推動者黃文龍等。更令外界意外的是,哈佛助理教授 Yilun Du 也參與其中。李飛飛與 Yilun Du 恰好是具身智慧領域兩條技術路線的代表人物:一個主張讓 AI 直接在視覺畫面中思考,另一個主張先將一切壓縮為抽象數字再思考。兩人學術交集極少,上次合作還是五年前 Yilun Du 在 MIT 讀博期間,此後觀點一直存在分歧。此次同署一篇論文,被解讀為兩條路線可能找到了某種共識。

論文的核心觀點是,機器人或許根本不需要自己的專屬大模型,甚至無需重訓已有的影片生成模型,只需找到合適的介面,就能直接利用日趨成熟的影片生成模型。這一結論對當前產業界構成挑戰,因為許多大廠和創業公司正投入巨資研發機器人大模型,不少創業公司僅憑一個基座模型就撐起數十億估值。

過去,影片生成模型雖然具備物理直覺,但無法直接控制機器人,因為機器人操作需要關節角度、末端位移等低層動作表徵,這與影片模型理解的畫素流動、顏色變化語言完全不對應。此前的研究嘗試過多種方案,如 UniPi 用文本引導影片生成規劃,但文字指令模糊;Track2Act 用點軌跡預測,但稀疏的點難以描述連續動作;Ctrl-world 直接輸入關節角度,卻因換機械臂即失效而顯得脆弱。這些方法的共同問題是強迫影片模型學習一門它不熟悉的外語。

MVA 的思路則相反,它用影片模型自己的語言——畫素——來傳達動作。具體分為三步:首先,用 Meta 的 SAM 工具將影片中的機器人和操作物體分割出來,得到隨時間變化的區域,形成兩條運動軌跡;其次,遮住其中一條軌跡,讓模型預測被遮住的部分,從而同時實現世界模擬(給定機器動作推演世界變化)和動作生成(給定世界變化反推機器動作),且始終使用同一個模型、同一套引數;最後,不從頭訓練模型,而是用 LoRA 微調阿里的開源影片生成模型 Wan2.2(140 億引數),僅用 15 小時資料即可讓機器人實現 zero-shot 泛化,從單臂操作泛化到未見過的雙臂機器人。

論文的實驗結果頗具說服力。在衡量生成畫面與真實畫面差異的 LPIPS 指標上,MVA 達到 0.0945,而對比方法 Ctrl-World 為 0.362,差距近四倍。更關鍵的是,當測試時換上訓練階段從未見過的雙臂機器人時,Ctrl-World 當場失靈,而 MVA 仍能輸出靠譜的預測。論文還演示了三種應用:為現有策略打分、作為規劃器、以及反推動作。

產業界人士對這篇論文的評價聚焦於其泛化能力。深圳韋特嘉機器人 CTO 李琳鑫指出,文章的核心不在於模型訓得好,而在於泛化性的增強,解決了異構機械手的識別與遷移問題。他特別提到論文中關於 URDF 的細節:MVA 在生成動作時,先通過逆運動學(IK)解算出各關節的配合,而不是直接輸出與特定本體繫結的低層動作表徵。這使得指令可以通用,而執行方式各自適配。URDF 檔案作為機器人的通用說明書,記錄了關節數量、角度限制、連桿長度等資訊,MVA 利用它既限制了影片生成模型的想象力,又實現了跨本體泛化。

李琳鑫還指出,具身智慧領域今年的行業趨勢是將“看”和“動”拆開:視覺部分用網際網路海量影片訓練,資料量遠超機器人實機資料;動作部分用相對少的機器人資料加運動學計算補齊。MVA 正好卡在這個趨勢的介面上。儘管李琳鑫團隊走的是受 Yann LeCun 影響的隱空間世界模型路線,但他認為在 URDF 匯入和 IK/FK 解算上,兩條路線可以結合,思路甚至相通。

這篇論文的深層含義在於,具身智慧的發展或許不在於把機器人專屬模型越練越大,而在於想辦法直接借用已經很強的視覺大模型。網際網路影片資料近乎無窮,而機器人真機操作資料稀缺且昂貴,誰能讓機器人有效利用前者,誰就握有更大的籌碼。當學術界的頂尖力量與產業界的架構變化不約而同指向同一方向,這條路徑值得密切關注。