微软近日在 Hugging Face 上发布了名为 MuseVLA 的机器人操作模型,并将其代码、预训练权重与数据集一并开源,许可协议为 MIT。MuseVLA 是一个自适应多模态感知的视觉-语言-动作(VLA)模型,专为机器人操作设计,其核心思路是将新型传感器视为“按需工具”,在任务执行过程中动态选择所需模态,并将传感器观测与 RGB 图像对齐,最终生成机器人动作指令。
据模型页面介绍,MuseVLA 在 VITRA 的基础上构建,支持 热成像、声学、毫米波雷达 以及常规的 RGB 视觉输入。这种设计使机器人能够根据任务需求灵活调用不同传感器,例如在黑暗或烟雾环境中依赖热成像,在透明物体识别时借助声学信号,在遮挡场景下使用毫米波雷达穿透感知。模型在热、声、雷达引导的操作任务中取得了 80.6% 的平均成功率,在从未见过的传感器引导任务上平均成功率达到 66.7%,显示出一定的泛化能力。
从技术架构看,MuseVLA 属于视觉-语言-动作模型,即通过自然语言指令和视觉观测来生成机器人动作序列。与常见的固定多模态融合不同,MuseVLA 强调“自适应”——它首先判断当前任务需要哪种传感器模态,然后在该模态的观测中定位与任务相关的区域,并与 RGB 图像进行空间对齐,最后输出动作。这种“先选模态、再对齐、后动作”的流程,可能有助于减少多传感器数据融合的计算开销,并提升模型在不同传感器配置下的适应性。
此次开源对机器人学习社区而言是一个值得关注的信号。微软在机器人基础模型领域持续投入,MuseVLA 的发布为研究者提供了一个可复现的多模态 VLA 基线。由于代码和权重均以 MIT 许可 开放,开发者可以自由修改和商用,这降低了后续研究的门槛。同时,模型配套的 MuseVLA-dataset 数据集也一并公开,为训练类似模型提供了数据基础。
从产业视角看,VLA 模型被视为具身智能的关键技术路径之一。传统机器人编程依赖人工设计的控制逻辑,而 VLA 模型试图让机器人从语言和视觉中直接学习动作策略。MuseVLA 对多模态传感器的支持,可能使机器人在工业检测、家庭服务、搜救等场景中更具鲁棒性——例如在光线不足或视线受阻的环境中,热成像和毫米波雷达能提供互补信息。不过,当前模型的成功率和泛化能力仍有限,尤其是在未见传感器上的表现(66.7%)与已知传感器(80.6%)存在差距,说明跨模态迁移仍是挑战。
对于关注 AI 产业的投资人而言,MuseVLA 的发布体现了大厂在机器人基础模型上的竞争加剧。微软、谷歌、英伟达等公司均在探索将大语言模型与机器人控制结合,而多模态感知的融合能力可能成为差异化竞争点。开源策略有助于吸引开发者生态,但也意味着技术壁垒可能更多体现在数据质量和后续迭代上。目前,MuseVLA 仍处于研究阶段,其实际部署效果和商业化路径尚待观察,但其开源性质为行业提供了可借鉴的范式。