在9月27日于美国匹兹堡举行的IROS 2026研讨会“Perception and Decision Making for Athletic Humanoid Robotics”上,来自中国动易科技(PHYBOT)的刘晨澔展示了人形机器人羽毛球项目的最新进展:一台1.35米高的人形机器人能够与人类连续对拉超过40拍,并能在仿真环境中通过自我博弈学习战术决策。
羽毛球之所以成为检验人形机器人运动能力的试金石,在于其独特的物理复杂性。一颗被重杀的羽毛球初速可达两三百公里每小时,但受十六片羽毛带来的巨大空气阻力影响,速度在飞行中急剧衰减,轨迹呈现前段平直、后段陡降的不对称弧线。加之球体一头软木一头羽毛,重心与压力中心错开,每颗球在半空都会自行翻转,使得轨迹预测极为困难。对机器人而言,这要求一套分工明确的“大小脑”架构。
刘晨澔介绍,团队此前在2025年11月发表论文,用三阶段课程训练出一个统一的全身控制器,不依赖动作先验和专家演示,真机出球速度最高达每秒19.1米。在此基础上,团队做了三方面推进。
首先是让球打得准。团队引入人类参考动作,用多个判别器分别学习上旋、下旋、正反手等风格,再训练一个学习型技能选择器,为每个来球挑选任务表现最好的技能。目前使用了三个分别对应上手、下手正手和下手反手的判别器。
其次是让机器人学会“算球”。高层采用GRU策略同时决定击球技巧和落点,并借鉴联赛式的零和多智能体强化学习,在模拟中不断制造更强的对手,暴露并修补策略弱点,低层则由全身控制器执行。团队采用不同角色的联盟训练:主智能体负责提升整体表现,主力陪练主动寻找主智能体弱点,联盟陪练则引入更多样化的策略。
第三是验证这套分工能复用、能落地。同一框架用大约一周迁移到乒乓球和足球,还带到商场快闪场馆中与真人互动。
在自主性方面,团队还开发了DQ-Flow,用于解决机器人自主拾取羽毛球的全身移动操作问题。其核心思想是将运动生成与运动执行分离:DQ-Flow决定执行何种运动,全身控制器负责如何可靠执行。策略利用短时RGB观测历史和本体感知信息,通过flow matching生成全身运动参考。训练时引入深度查询帮助动作表征学习几何信息,但部署时机器人只需RGB图像和本体感知。下肢和躯干用强化学习控制器跟踪以保证平衡和鲁棒性,上肢和夹爪则直接跟踪生成目标以实现精准操作。
从产业视角看,这项工作的意义在于将策略博弈与本能执行明确拆开,并验证了分层架构在不同球类运动间的可迁移性。刘晨澔强调,实际部署与实验室环境存在根本差异,机器人必须应对噪声、延迟、干扰以及分布外输入,最佳解决方案往往并非理论最优解,而是能在现实世界中可靠运行的方案。目前,高层战术决策的结果仍仅限于模拟环境,下一步是在真实机器人上验证。