動易科技劉晨澔:人形機器人羽毛球對拉 40 拍背後的分層革命 | IROS 2026

2026年9月29日 07:49
站內 AI 整理稿

頂會上的人形機器人高動態運動場景的最新工業級進展。作者丨鄧哲敏 編輯丨齊鋮湧 羽毛球大概是所有球類裡最“不講道理”的項目。一顆球被重殺出去時,初速能飆到兩三百公里每小時,卻因為十六片羽毛帶來的巨大空氣阻力,速度在飛行中急劇衰減。軌跡也不再是拋物線,變為前段平直、後段陡降的不對稱弧線。同時,一頭是軟木、一頭是羽毛,重心和壓力中心錯開,每顆球在半空都會自己翻跟頭。這個翻轉,讓它的軌跡變得更難預測。可以說,打羽毛球是一場動態的冥想,身體要靈敏移動,心卻要足夠安靜,才能提前一秒“看”到落球點。對於人形機器人來說,這種難度係數的動靜結合,需要一套分工明確的大小腦。小腦這一層,過去三年進化很快。

人形機器人的全身控制已經從“走得穩”走到“學得像”:先用人體動捕數據訓練機器人跟蹤各類動作,再靠系統辨識、域隨機化縮小仿真與現實的差距,跑、跳、舞蹈這類技能逐漸穩定,也出現了讓機器人復現高動態全身動作的工作,比如 ASAP 提出的對齊仿真與真實物理的方法。在此基礎上,球類成了檢驗大小腦的新考場。回顧領域內過去的工作,能看到兩個趨勢。一是分層:AdaPT 的核心思路,就是讓規劃器生成風格化動作,讓跟蹤器負責執行,並儘量不干擾規劃;HITTER、LATENT 也都是“高層決策,低層執行”的結構。二是人類先驗:動捕、視頻、業餘數據,都在給機器人提供人類運動的經驗。

但行業裡仍有一塊相對空白,多數工作解決的是接球的問題,而關於如何打贏對手的策略層,公開成果還不多。羽毛球恰好把這個矛盾放大,落點區域廣、步法頻繁、球速衰減快,是策略與執行分離最值得檢驗的場景。9 月 27 日,美國匹茲堡,IROS 2026 workshop 日,來自中國動易科技(PHYBOT)的劉晨澔站上講臺,他和團隊把策略博弈和本能執行這兩件事拆開,成功讓一臺 1.35 米高的人形機器人和人類對拉四十餘拍,並能在仿真裡靠自我博弈學會算球。團隊的人形羽毛球工作早有技術積累。

25 年 11 月,劉晨澔作為一作發表論文,用三階段課程訓練出一個統一的全身控制器,不依賴動作先驗和專家演示,真機出球速度最高達每秒 19.1 米。此後團隊做了三件事: 1.讓球打得準。引入人類參考動作,用多個判別器分別學習上旋、下旋正反手等風格;再訓練一個學習型技能選擇器,為每個來球挑選任務表現最好的技能。2.讓機器人學會算球。高層用 GRU 策略同時決定擊球技巧和落點,並借鑑聯賽式的零和多智能體強化學習,在模擬裡不斷製造更強的對手,暴露並修補策略弱點,低層則由下層全身控制器執行。3.驗證這套分工能複用、能落地。同一框架用大約一週遷移到乒乓球和足球,還帶到商場快閃場館中與真人互動。

以下是劉晨澔在 IROS 2026 “Perception and Decision Making for Athletic Humanoid Robotics” Workshop 上發表的演講精編稿。AI 科技評論(公眾號)基於現場英文演講進行了編輯,在不改變原意的基礎上,對口語表達和技術術語進行了重新梳理。▎Humanoid Badminton: Bringing Athletic Robots from the Lab to the Court主講人:劉晨澔,動易科技(PHYBOT)01為什麼偏偏是羽毛球大家早上好!

能受邀參加本次研討會,並與在座各位探討人形機器人在體育運動領域的最新進展及未來前景,我深感榮幸,也倍感興奮。我是來自中國動易科技的劉晨澔,目前帶領團隊做人形機器人在球類體育運動中的研發工作。今天我演講的題目是《人形羽毛球:把運動機器人從實驗室帶進球場》。和許多來自學術界的資深研究人員不同,我將更多地從工業視角來探討這一主題,不僅分享我們如何開發這些運動能力,還將介紹如何將它們從實驗室帶到實際賽場,並使其真正投入使用。過去幾年,人形機器人在運動任務上取得了顯著進步。跑步、跳躍和跳舞等傳統運動技能已經變得越來越穩健和可靠。因此,研究界開始關注一個更具挑戰性的問題:人形機器人能否應對動態體育運動?

我們目前在球類運動中看到了快速進展。在足球和籃球領域,人形機器人已經能夠完成射門、守門和投籃等動態任務。這些任務通常只需與球進行一次短暫接觸即可完成。最近,我們看到球拍類運動(racket sports)裡也出現了一些令人印象深刻的演示,包括網球、乒乓球,當然還有羽毛球。更重要的是,這些系統已不再侷限於孤立的演示:機器人開始和人對拉、相互競技,甚至參加一些有組織的比賽。這一轉變對我們來說尤為有趣,因為球拍類運動帶來了截然不同的挑戰。這種挑戰既涉及控制,也涉及感知。首先,目標體積小得多,對精度的要求大約高出一個數量級。其次,這些都是以多回合對打為基礎的運動。

因此,機器人必須不僅要一次,還要反覆、可靠地擊中球。再次,機器人通過球拍與球體進行交互。因此,在關節處微小的誤差會在球拍處被放大,再加上極高的球速,形成了一個非常狹窄的擊球窗口。此外,觸球、飛行動力學和旋轉,讓問題變得更加棘手。那麼,為什麼選擇羽毛球呢?羽毛球在飛行中會承受極強的空氣阻力,導致它的速度迅速且非線性地衰減,這讓軌跡預測變得尤其困難。打羽毛球還需要頻繁的加速與減速,既考驗下肢的敏捷,也考驗精準的揮拍時機。此外還有一個實際原因,中國有龐大的羽毛球愛好者群體。因此,對我們而言,人形機器人打羽毛球不僅是一個具有挑戰性的研究課題,也是將人形機器人引入現實人類環境的充滿前景的應用場景。

正如今天演講題目說的那樣,我們的目標是讓人形機器人從實驗室走向真實的運動場。不僅限於羽毛球,還包括更廣泛的體育場景。02小腦先練步法與揮拍實際部署與實驗室環境有著根本性的差異。機器人必須應對噪聲、延遲、干擾以及分佈外的輸入,這對可靠性的要求大大提高。而且,進行體育運動只是系統的一部分,實際部署還要求具備導航、撿球、跌倒恢復以及長期穩定運行的能力。因此,這不僅僅是一個算法問題,還需要在實踐中進行廣泛的測試、系統集成和硬件迭代。最佳解決方案往往並非理論上的最優解,而是能在現實世界中可靠運行的方案。我想這也是具身智能之所以有趣的原因之一。這張圖給我們一個整體路線圖的概覽。

今天,我們將從移動和發力開始,先讓機器人移動到正確的位置,並在恰當的時機揮動球拍擊球。隨後,我們將轉向機器人需要掌握的各種技能,以應對不同的球路、覆蓋更廣的場地範圍,並控制羽毛球的落點。一旦掌握了這些基本技能,我們就可以開始思考戰術了,不僅要考慮如何擊球,還要考慮使用哪種擊球方式以及將球打到什麼位置。除了進行多拍對打,我們還希望機器人能夠自主運作,例如,在球場內自主導航並撿拾羽毛球。最後,我們將所有內容整合起來,實現真實環境部署,屆時整個系統需要在實驗室之外可靠地運行。因此,本次演講的其餘部分將遵循這一路徑:從控制到技能,再到策略,繼而到自主性,最終實現真實環境部署。

那麼,讓我們從移動和步法開始。在我們的早期研究中,我們通過一套退火式課程的全身控制訓練方案解決了這一問題,從而在動作捕捉環境中首次實現了人形機器人打羽毛球的實地演示。羽毛球運動集中體現了人形機器人面臨的諸多挑戰。其中最關鍵的一點是,需要協同學習步法和擊球動作。尤其是考慮到寬廣的三維工作空間以及擊打動作對全身穩定性的影響,這兩個目標在優化過程中往往會相互衝突,我們通過退火式課程學習的訓練方案解決了這一衝突。具體來說,在第一階段,我們在訓練中僅引入下肢移動項。隨後,我們逐漸移除下肢移動獎勵,並使擊球獎勵佔據越來越主導的地位。

通過這種設計,移動獎勵可以在早期為稀疏擊球目標提供引導,從而穩定早期的訓練過程。與此同時,已習得的下肢動作和能力會被保留在策略中,即使在下肢移動獎勵被移除後也是如此。因此最終形成了協調的全身動作。右側的視頻記錄了我們去年 11 月首次在實驗室完成擊球測試。在基礎擊球能力的基礎上,我們進一步擴展了該系統,使其能夠學習多種擊球技巧並實現目標落點的精準控制。這使得機器人具備了多種擊打方式,從而提升了回球的可靠性。我們的機器人單回合可以連續對拉 40 拍以上。與我們之前基於標準 PPO 且僅採用獎勵設計的成果不同,我們收集了一組涵蓋不同風格的參考動作,並採用多個判別器來分別捕捉這些風格。

這種多判別器方法使策略能夠習得多樣化的擊球技巧,同時允許在未來融入更多技巧。目前,我們使用了三個分別對應上手、下手正手和下手反手的判別器。為了實現精準的回球控制,我們引入了兩項改進:目標回球控制和學習型技能選擇器。首先,基於退火式課程設計,我們引入了回球獎勵,在模型成功掌握擊打動作後,進一步訓練策略以控制落點。此外,我們還在策略觀測中加入了目標區域的獨熱編碼。這些修改綜合起來,使得落點分佈更加準確且集中,如圖所示。其次,我們訓練了一個技能選擇器。它實際上是一個已學習的狀態—動作價值函數,即 Q 值函數。

因此,對於每個來球軌跡,我們在模擬中評估了在相同擊打條件下所有可用的技能,並記錄了它們的任務效用。這裡的任務效用定義為擊中獎勵與回球落點獎勵的乘積。隨後,我們訓練該網絡在不同擊打條件下預測這些技能的任務效用,並執行任務效用最高的技能。通過這種方式,技能選擇器能夠利用所有技能的互補優勢,為每種情況選擇最合適的技能。正如這裡的模擬對比所示,沒有技能選擇器的系統會導致回合過早結束。然而,配備技能選擇器的系統則能繼續對峙。把上述方法結合在一起,我們取得了如下成果。據我們所知,我們的系統在腿式機器人羽毛球比賽中實現了最長的對峙回合。我花幾分鐘放一下視頻,讓大家更直觀地瞭解系統表現。

視頻裡,正在和機器人對打的這個人就是我。我們的機器人只有 1.35 米高,但它能覆蓋 4.4×4.4 米的場地。技能選擇器會替機器人選合適的技能——比如現在,因為我把球打到了那個區域,它就選了反手,因為在那個位置反手是最優解。和我們的 PHYBOT C2 對打真的非常有趣,但很遺憾,我們沒法把機器人運到美國來,所以今天不能做現場演示。好,因為時間非常有限,我就先停在這裡,繼續往下講。03大腦上場學會算球人形機器人不應止步於娛樂性演示。下一步是讓機器人具備競爭力,能夠做出戰略決策、適應不同的對手,並最終獲勝。為此,我們將這一高層級問題表述為零和博弈,即零和多智能體強化學習問題。

在此,主智能體持續針對一組歷史對手進行訓練,而優先採樣虛擬自博弈(PFSP)則將訓練重點放在當前策略仍難以戰勝的對手身上。一旦勝率達到足夠高的水平,我們會保存一個新的快照,並從該檢查點繼續訓練。高層策略會觀察機器人狀態、擊球狀態、對手狀態以及之前的決策,並利用循環神經網絡。在此,我們使用 GRU 輸出兩個離散決策。第一個是決定使用哪種擊球方式,即擊球技巧;第二個是決定將回球打向何處。這些決策隨後被傳遞給固定的低層全身控制器,該控制器負責執行選定的擊球方式和落點目標。因此,這裡的職責劃分非常明確。低層負責回答如何執行擊球,而高層負責學習戰術。

然而,僅靠純粹的自博弈是不夠的,因為如果策略僅針對一組有限的對手,會陷入循環支配的困境。循環支配的一個簡單例子就是“石頭、剪刀、布”遊戲,針對一種策略的改進可能會立即暴露對另一種策略的弱點。因此,我們採用不同角色的聯盟訓練。其中,主智能體(Main Agent)負責提升整體表現;主力陪練(Main Exploiter)主動尋找主智能體的弱點;聯盟陪練(League Exploiter)則引入更多樣化的聯盟級策略。三者一起,源源不斷地製造出強對手,從而暴露並修復策略層面的弱點。此處的圖表顯示,隨著訓練的進行,主智能體在面對歷史上的強敵(尤其是陪練策略)時,表現逐漸提升。

與此同時,訓練中智能體不斷暴露新的弱點,而訓練重點始終放在那些仍難以戰勝的對手上。因此,該智能體不僅是在提高整體勝率,還在學習如何彌補自身的弱點並利用對手的弱點。目前,這些結果仍僅限於模擬環境。我們的下一步是在真實機器人上對這些結果進行驗證。我們還希望通過這種競爭性訓練過程,更好地理解這些高級策略是如何自我進化的。正如視頻中所示,我們的智能體 12 的表現遠勝於智能體 10(歷史版本)。除了羽毛球之外,我們還測試了這些能力能夠多快地遷移到其他球類運動中。利用前面提到的同一框架,我們僅用一週左右就成功將模型遷移到了乒乓球和足球領域。

這種快速遷移表明,許多核心能力——如全身協調、動態交互和任務層面的適應——並不侷限於羽毛球,而可以在不同的體育任務中重複使用。打羽毛球只是向前推進這一通用能力的一部分。04從實驗室到球場機器人還需要具備一些輔助技能,例如自主拾取羽毛球。這是一個具有挑戰性的全身移動操作問題,因為在任務執行過程中,機器人的視角和自身構型都在不斷變化。為解決這一問題,我們提出並開發了 DQ-Flow,其核心思想是將運動生成與運動執行分離。DQ-Flow 決定執行何種運動,而全身控制器則負責如何可靠地執行該運動。從視頻中可以看到,機器人即使存在一些干擾,它也能自主靠近並拾取羽毛球。圖片是對整套系統的概覽。

DQ-Flow 接收第一人稱觀測和機器人狀態,生成一個全身運動參考。在訓練期間,我們引入輔助的深度監督,幫助策略學到更好的幾何表徵。重要的是,這些深度信息在部署時是不需要的,它只是一個訓練信號。生成的參考隨後由我們的混合全身控制器來執行。右側是我們使用的數據採集管線,用來採集演示並生成訓練參考。現在我們更仔細地看一下 DQ-Flow 背後的關鍵思想。策略利用一段短時的 RGB 觀測歷史,再加上本體感知信息,通過 flow matching 生成全身運動參考。這裡的核心做法,是在訓練時引入深度查詢,它們幫助動作表徵從場景中學到幾何信息,而動作策略本身並不依賴深度。

所以在部署時,機器人只需要 RGB 圖像和本體感知即可。隨後,生成的運動將通過混合式接口交由全身控制器執行。下肢和軀幹用強化學習控制器來跟蹤,這些部位對平衡和魯棒性要求更高;而上肢和夾爪則直接跟蹤生成的目標,以實現精準操作。重要的是,演示數據和 DQ-Flow 使用的是同一套參考表徵。這給了我們一個統一的接口,把數據採集、策略學習和全身執行連接在了一起。最後一點,是 DQ-Flow 如何與低層控制器實時協同工作。這兩個模塊是異步運行的:當機器人正在執行當前動作時,新的參考通過一個時間對齊的交接平滑地對齊到當前執行上。這樣機器人就能持續移動,而不必停下來等上層策略推理。

簡而言之,策略生成未來動作,而控制器則確保機器人持續移動。最後,這是在真實機器人上運行的完整系統,僅利用安裝在頭上的攝像頭,機器人便能自主靠近羽毛球、拾取、運輸並將其放入目標箱中。在整個任務中,DQ-Flow 生成運動參考,混合接口全身控制器實時執行它,從視覺到運動生成,再到真機上的全身執行,這就是我們的完整鏈路。我們還利用常規的策略蒸餾方法,探索了自主撿球的另一種實現路徑。首先,我們在模擬環境中利用羽毛球位置的特權信息訓練一個教師策略,然後通過退火 DAgger 讓學生策略只用安裝在夾爪上方的攝像頭採集的 RGB 觀測數據,去克隆教師的行為。

學生策略直接輸出全身關節目標,完成下蹲、抓取、最後把球提起的整套動作。最終,我們將該系統帶出了實驗室,並部署在真實的公共環境中。這些照片來自我們的羽毛球快閃場館,在一家商場裡,機器人與不同的人直接互動。對我們來說,這是整個項目裡非常重要的一部分,因為真實部署會暴露大量在實驗室裡難以復現的問題,包括通信、感知、噪聲、形形色色的用戶,以及長期的系統可靠性。這才是我們所說的把機器人從實驗室帶進球場的真正含義。05五條要點最後,讓我總結幾點要點。第一,人類先驗仍然非常重要。一味的擴大數據規模是不夠的,如何有效地利用這些先驗,仍然是一個開放的問題。第二,人類先驗提供的是基礎,而競爭驅動的是進一步的提升。

就像學羽毛球,看教練示範當然有幫助,但真正的進步來自實戰,尤其是和強對手交手。第三,僅靠仿真已經不夠了,我們需要更廣泛的方法,可以是更好的系統辨識,可以是世界模型,甚至可以是真實世界的強化學習。第四,工程和算法創新同樣重要。對於同一個策略,更好的微調、更低的延遲、更好的控制、更好的硬件,都可能帶來巨大的差異。最後,運動智能是一個系統級的問題。把機器人從實驗室帶到球場,需要策略、自主性、可靠性,以及真實世界的運行能力。我想,今天要講的都在這裡了。謝謝大家。06現場問答▎Q:在剛才的視頻裡,和羽毛球機器人對打時,它用的是外部感知嗎?一共用了多少個攝像頭?球速有多快?

是的,用的是動捕系統,一共 8 個攝像頭。至於球速,快球(比如殺球)能達到每秒 20 米以上。▎Q:你提到技能選擇器會觀測球的狀態,還提到了對手狀態,這個對手狀態具體是什麼?技能選擇器裡其實沒有對手這個概念,我們訓練它只是為了給來球落點區域選出最合適的技能。至於對手狀態,是在後面那套高層多智能體強化學習裡出現的.仿真環境裡有對手,對手狀態包括對手的位置、線速度和角速度,這樣它就知道對手在哪裡。這些也是通過動捕來估計的。▎Q:真實世界裡有空氣阻力這樣的空氣動力學效應,你們在仿真器裡也模擬了嗎?是的,我們模擬了空氣動力學。▎Q:從仿真到真實世界,你們做的是零樣本遷移,還是用了其他方法?

是零樣本遷移,主要通過域隨機化和加噪聲來實現,沒什麼特別花哨的東西。▎Q:如果想讓機器人更快、更有競爭力,尤其是面對羽毛球裡的殺球,你會怎麼做?我認為目前的主要限制在硬件——關節力矩和關節峰值速度。我們可以通過改進、迭代硬件來做得更好。攝像頭不是瓶頸,因為動捕系統可以做到 200 赫茲以上。▎Q:實際實時運行時,你們用的是動捕,還是端側相機?目前用的是動捕。為了方便大家抱團交流、互通會議消息,專門建了 IROS 2026 參會交流群!進群你會解鎖這些「福利」?會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。

同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 session、Keynote 探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?進群傳送門: 掃碼進群或添加微信Luyoyo_2026,備註:ECCV + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。

來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

特斯拉機器人5000臺訂單落地,審廠在即

我需要先說清楚一件事:你給的「來源資料」其實只有一則標題,其餘幾乎全是 的導航列、頁尾與備案資訊(訂閱、舉報電話、ICP 備案號等)。真正能確認的內容只有: - 標題:特斯拉機器人 5000 臺訂單落地,審廠在即 - 兩則相關標題:〈0.

1 週前

機器人,去養豬場摔豬

機器人應用場景持續擴大,如今連養豬場也開始導入自動化設備。近期有消息指出,部分養豬場已嘗試使用機器人執行「摔豬」作業,這項原本需要人力完成的工序,正逐步交由機械手臂或專用機器來處理,藉此降低勞動強度並提升生產效率。 所謂「摔豬」,在養殖實務中通常指將仔豬從高處輕放至地面或特定區域的動作,或是協助豬隻進行體重測量、疫苗接種前的定位與翻轉。傳統上這類工作耗費體力且容易造成人員受傷,導入機器人後不僅能標準化作業流程,也能減少人豬接觸帶來的緊迫感,對動物福利亦有正面幫助。

1 週前

機器人企業還沒拿到“大結果”

根據的報導指出,目前機器人企業在商業化與技術落地的過程中,仍未迎來所謂的「大結果」。儘管市場對機器人產業寄予厚望,但從實際進展來看,多數企業尚未取得足以改變產業格局的突破性成績。業界普遍認為,機器人技術從實驗室走向量產應用,仍面臨成本、場景適應性與核心算法等多重挑戰。 與此同時,人形機器人領域持續有新動態曝出。知名機器人平台Atlas近期利用3D重建技術為自主導航開闢新路徑,讓業界開始重新審視世界模型的評估方式。

1 週前