樂聚機器人今日宣佈推出面向工業場景的垂域具身智慧模型KUAVO VLA。該模型以通用VLA基礎模型為能力起點,使用600+小時的KUAVO同構型真機資料進行中訓練,將本體適配、基礎操作和工業場景的共效能力沉澱到模型中。據樂聚介紹,在KUAVO VLA賦能下,不少工業場景可實現約一倍的提效,某些任務成功率甚至達到100%

在具身智慧領域,預訓練和後訓練是常見的技術路徑,但樂聚此次強調的“中訓練”卻較少被提及。預訓練的VLA模型在具體場景中往往難以發揮全部智慧,而後訓練則面臨時間與成本門檻,且技能訓練環節容易出現數據採集、訓練和除錯的重複工作。樂聚認為,中訓練或許是VLA落地提效的破局良方。

KUAVO VLA被定義為“垂域模型”,即通用基模與具身技能之間的“中間層”。樂聚的思路是先將KUAVO本體能力和工業場景的共效能力訓練進垂域模型,再將具體技能的學習範圍收斂到工業場景,從而獲得更高的能力起點。該模型詳細訓練了100個“工業共效能力”,涵蓋分揀、搬運、上下料、裝配等典型操作,使模型能快速依靠“原子動作”完成任務,甚至實現能力泛化。與跨本體混合訓練不同,KUAVO VLA的訓練資料全部來自KUAVO單一構型,使模型與本體深度繫結,減少推理誤差,提升執行效率。

在評估方面,KUAVO VLA的測試體系共設定25項任務,包括20項定製化工業任務和5項來自公共任務集GM100的任務,對照模型為π 0.5、GR00T N1.7和Lingbot-VLA 2.0三種通用基模。綜合結果顯示,KUAVO VLA整體任務成功率達48.27%,過程分達74.51%,兩項指標均位列第一。相較於基模Lingbot-VLA 2.0(任務成功率16.27%、過程分42.06%),KUAVO VLA成功率提升32%,過程分提升32.45%。成功率與過程分同步提升,表明垂域訓練不僅影響任務完成度,也改善了執行過程,如動作平滑性、決策穩定性與執行一致性,減少了動作抖動和決策遲滯,這對多步操作、連續抓放和狹小工位約束的工業任務尤為重要。

樂聚常務副總裁柯真東表示,未來會有很多具身開發者沉到行業裡去,在場景中調出相應技能,樂聚提供的是平台、模型和工具鏈。樂聚已舉辦多次具身開發比賽,為開發者配置工具鏈和機器人培訓,並設有專門服務二次開發生態的團隊,直接端到端解決開發者問題。柯真東強調,對二次開發團隊而言,能夠讓他們賺到錢的平台就是最好的平台。KUAVO VLA的出現,有望讓過去耗時耗錢的技能開發變得效率更高、浪費更少,降低門檻、加快過程、提升效果。

樂聚在具身領域的技術積累和工業實踐,使其能夠歸納出機器人最有價值的“原子動作”,並在自家訓練場獲得適合中訓練的海量資料。同時,樂聚不繫結基礎模型,允許開發者自由在模型間遷移並享受效能提升。KUAVO VLA的釋出,不僅是樂聚在具身版圖上的新進展,也是行業在具身大腦技術範式上的一次探索。柯真東將垂域模型比作“讓鞋子上沾泥”的事情,即把腳深深踩進實際場景,將樂聚積累的工業Know-how沉澱到模型中,幫助更多二次開發者拿到訂單。