乐聚机器人今日宣布推出面向工业场景的垂域具身智能模型KUAVO VLA。该模型以通用VLA基础模型为能力起点,使用600+小时的KUAVO同构型真机数据进行中训练,将本体适配、基础操作和工业场景的共性能力沉淀到模型中。据乐聚介绍,在KUAVO VLA赋能下,不少工业场景可实现约一倍的提效,某些任务成功率甚至达到100%

在具身智能领域,预训练和后训练是常见的技术路径,但乐聚此次强调的“中训练”却较少被提及。预训练的VLA模型在具体场景中往往难以发挥全部智能,而后训练则面临时间与成本门槛,且技能训练环节容易出现数据采集、训练和调试的重复工作。乐聚认为,中训练或许是VLA落地提效的破局良方。

KUAVO VLA被定义为“垂域模型”,即通用基模与具身技能之间的“中间层”。乐聚的思路是先将KUAVO本体能力和工业场景的共性能力训练进垂域模型,再将具体技能的学习范围收敛到工业场景,从而获得更高的能力起点。该模型详细训练了100个“工业共性能力”,涵盖分拣、搬运、上下料、装配等典型操作,使模型能快速依靠“原子动作”完成任务,甚至实现能力泛化。与跨本体混合训练不同,KUAVO VLA的训练数据全部来自KUAVO单一构型,使模型与本体深度绑定,减少推理误差,提升执行效率。

在评估方面,KUAVO VLA的测试体系共设置25项任务,包括20项定制化工业任务和5项来自公共任务集GM100的任务,对照模型为π 0.5、GR00T N1.7和Lingbot-VLA 2.0三种通用基模。综合结果显示,KUAVO VLA整体任务成功率达48.27%,过程分达74.51%,两项指标均位列第一。相较于基模Lingbot-VLA 2.0(任务成功率16.27%、过程分42.06%),KUAVO VLA成功率提升32%,过程分提升32.45%。成功率与过程分同步提升,表明垂域训练不仅影响任务完成度,也改善了执行过程,如动作平滑性、决策稳定性与执行一致性,减少了动作抖动和决策迟滞,这对多步操作、连续抓放和狭小工位约束的工业任务尤为重要。

乐聚常务副总裁柯真东表示,未来会有很多具身开发者沉到行业里去,在场景中调出相应技能,乐聚提供的是平台、模型和工具链。乐聚已举办多次具身开发比赛,为开发者配置工具链和机器人培训,并设有专门服务二次开发生态的团队,直接端到端解决开发者问题。柯真东强调,对二次开发团队而言,能够让他们赚到钱的平台就是最好的平台。KUAVO VLA的出现,有望让过去耗时耗钱的技能开发变得效率更高、浪费更少,降低门槛、加快过程、提升效果。

乐聚在具身领域的技术积累和工业实践,使其能够归纳出机器人最有价值的“原子动作”,并在自家训练场获得适合中训练的海量数据。同时,乐聚不绑定基础模型,允许开发者自由在模型间迁移并享受性能提升。KUAVO VLA的发布,不仅是乐聚在具身版图上的新进展,也是行业在具身大脑技术范式上的一次探索。柯真东将垂域模型比作“让鞋子上沾泥”的事情,即把脚深深踩进实际场景,将乐聚积累的工业Know-how沉淀到模型中,帮助更多二次开发者拿到订单。