在9月27日於美國匹茲堡舉行的IROS 2026研討會“Perception and Decision Making for Athletic Humanoid Robotics”上,來自中國動易科技(PHYBOT)的劉晨澔展示了人形機器人羽毛球專案的最新進展:一台1.35米高的人形機器人能夠與人類連續對拉超過40拍,並能在模擬環境中通過自我博弈學習戰術決策。
羽毛球之所以成為檢驗人形機器人運動能力的試金石,在於其獨特的物理複雜性。一顆被重殺的羽毛球初速可達兩三百公里每小時,但受十六片羽毛帶來的巨大空氣阻力影響,速度在飛行中急劇衰減,軌跡呈現前段平直、後段陡降的不對稱弧線。加之球體一頭軟木一頭羽毛,重心與壓力中心錯開,每顆球在半空都會自行翻轉,使得軌跡預測極為困難。對機器人而言,這要求一套分工明確的“大小腦”架構。
劉晨澔介紹,團隊此前在2025年11月發表論文,用三階段課程訓練出一個統一的全身控制器,不依賴動作先驗和專家演示,真機出球速度最高達每秒19.1米。在此基礎上,團隊做了三方面推進。
首先是讓球打得準。團隊引入人類參考動作,用多個判別器分別學習上旋、下旋、正反手等風格,再訓練一個學習型技能選擇器,為每個來球挑選任務表現最好的技能。目前使用了三個分別對應上手、下手正手和下手反手的判別器。
其次是讓機器人學會“算球”。高層採用GRU策略同時決定擊球技巧和落點,並借鑑聯賽式的零和多智慧體強化學習,在模擬中不斷製造更強的對手,暴露並修補策略弱點,低層則由全身控制器執行。團隊採用不同角色的聯盟訓練:主智慧體負責提升整體表現,主力陪練主動尋找主智慧體弱點,聯盟陪練則引入更多樣化的策略。
第三是驗證這套分工能複用、能落地。同一框架用大約一週遷移到乒乓球和足球,還帶到商場快閃場館中與真人互動。
在自主性方面,團隊還開發了DQ-Flow,用於解決機器人自主拾取羽毛球的全身移動操作問題。其核心思想是將運動生成與運動執行分離:DQ-Flow決定執行何種運動,全身控制器負責如何可靠執行。策略利用短時RGB觀測歷史和本體感知資訊,通過flow matching生成全身運動參考。訓練時引入深度查詢幫助動作表徵學習幾何資訊,但部署時機器人只需RGB影像和本體感知。下肢和軀幹用強化學習控制器跟蹤以保證平衡和魯棒性,上肢和夾爪則直接跟蹤生成目標以實現精準操作。
從產業視角看,這項工作的意義在於將策略博弈與本能執行明確拆開,並驗證了分層架構在不同球類運動間的可遷移性。劉晨澔強調,實際部署與實驗室環境存在根本差異,機器人必須應對噪聲、延遲、干擾以及分佈外輸入,最佳解決方案往往並非理論最優解,而是能在現實世界中可靠執行的方案。目前,高層戰術決策的結果仍僅限於模擬環境,下一步是在真實機器人上驗證。