微軟近日在 Hugging Face 上釋出了名為 MuseVLA 的機器人操作模型,並將其程式碼、預訓練權重與資料集一併開源,許可協議為 MIT。MuseVLA 是一個自適應多模態感知的視覺-語言-動作(VLA)模型,專為機器人操作設計,其核心思路是將新型感測器視為“按需工具”,在任務執行過程中動態選擇所需模態,並將感測器觀測與 RGB 影像對齊,最終生成機器人動作指令。
據模型頁面介紹,MuseVLA 在 VITRA 的基礎上構建,支援 熱成像、聲學、毫米波雷達 以及常規的 RGB 視覺輸入。這種設計使機器人能夠根據任務需求靈活呼叫不同感測器,例如在黑暗或煙霧環境中依賴熱成像,在透明物體識別時藉助聲學訊號,在遮擋場景下使用毫米波雷達穿透感知。模型在熱、聲、雷達引導的操作任務中取得了 80.6% 的平均成功率,在從未見過的感測器引導任務上平均成功率達到 66.7%,顯示出一定的泛化能力。
從技術架構看,MuseVLA 屬於視覺-語言-動作模型,即通過自然語言指令和視覺觀測來生成機器人動作序列。與常見的固定多模態融合不同,MuseVLA 強調“自適應”——它首先判斷當前任務需要哪種感測器模態,然後在該模態的觀測中定位與任務相關的區域,並與 RGB 影像進行空間對齊,最後輸出動作。這種“先選模態、再對齊、後動作”的流程,可能有助於減少多感測器資料融合的計算開銷,並提升模型在不同感測器配置下的適應性。
此次開源對機器人學習社群而言是一個值得關注的訊號。微軟在機器人基礎模型領域持續投入,MuseVLA 的釋出為研究者提供了一個可復現的多模態 VLA 基線。由於程式碼和權重均以 MIT 許可 開放,開發者可以自由修改和商用,這降低了後續研究的門檻。同時,模型配套的 MuseVLA-dataset 資料集也一併公開,為訓練類似模型提供了資料基礎。
從產業視角看,VLA 模型被視為具身智慧的關鍵技術路徑之一。傳統機器人程式設計依賴人工設計的控制邏輯,而 VLA 模型試圖讓機器人從語言和視覺中直接學習動作策略。MuseVLA 對多模態感測器的支援,可能使機器人在工業檢測、家庭服務、搜救等場景中更具魯棒性——例如在光線不足或視線受阻的環境中,熱成像和毫米波雷達能提供互補資訊。不過,當前模型的成功率和泛化能力仍有限,尤其是在未見感測器上的表現(66.7%)與已知感測器(80.6%)存在差距,說明跨模態遷移仍是挑戰。
對於關注 AI 產業的投資人而言,MuseVLA 的釋出體現了大廠在機器人基礎模型上的競爭加劇。微軟、谷歌、輝達等公司均在探索將大語言模型與機器人控制結合,而多模態感知的融合能力可能成為差異化競爭點。開源策略有助於吸引開發者生態,但也意味著技術壁壘可能更多體現在資料質量和後續迭代上。目前,MuseVLA 仍處於研究階段,其實際部署效果和商業化路徑尚待觀察,但其開源性質為行業提供了可借鑑的範式。