ZEST:Atlas 從任何動作來源學會地板舞、低爬與連續後空翻——零樣本上機
《Science Robotics》八月人形機器人專刊以 ZEST 為封面論文:這套由 RAI Institute 與 Boston Dynamics 開發的動作模仿框架,能從動作捕捉、單眼影片或純動畫訓練全身控制策略,並零樣本部署到 Atlas、Unitree G1 與 Spot 上,無需逐技能工程。
多年來,一支爆紅的機器人示範影片與一個真正可部署的機器人技能之間,差距是以「工程師·月」為單位計算的。每一項新行為——一個後空翻、一次鑽過管線的低爬、一套舞蹈動作——傳統上都需要專屬控制器、專屬的獎勵函數調校,以及一條從模擬到實體、脆弱無比的移植路徑。2026 年 8 月出版的《Science Robotics》第 11 卷第 117 期是完全以人形機器人為主題的專刊,其封面論文正是要把這條管線壓縮成單一介面:由 RAI Institute 與 Boston Dynamics 合作開發的 ZEST(Zero-shot Embodied Skill Transfer,零樣本 embodied 技能轉移)。
論文標題的主張相當直白:不需要逐技能工程的運動型機器人控制。在 Boston Dynamics 的全電動 Atlas 人形機器人上,用 ZEST 訓練的策略直接從動作捕捉資料學會了動態的多接觸技能——軍事低爬(army crawl)與地板舞(breakdancing)。表達性舞蹈與場景互動類行為(例如爬箱子)則是從普通的單眼影片轉移到 Atlas 與 Unitree G1 兩種平台上。框架的觸角還延伸到雙足之外:在 Spot 四足機器人上,ZEST 利用完全不遵守物理約束的動畫關鍵影格,做出包括連續後空翻在內的特技動作。這些策略全部只在模擬器中訓練,上機時零樣本部署——不需要在實體機器人上做任何微調。
為什麼逐技能工程是瓶頸
人形機器人的全身控制之所以困難,在於真正重要的行為都是高接觸密度且長時程的。一記地板舞的風車動作,需要手、肩、軀幹輪流成為支撐點,同時動量把雙腿甩過頭頂;一次軍事低爬則要求前臂與膝蓋持續貼地支撐,同時拖動身體其餘部分前進。傳統管線把每一項這類技能都當成獨特的控制問題來處理:工程師撰寫接觸時序、為每個階段設計獎勵項,然後反覆手調增益,直到模擬中的行為終於能在實體機器上存活。
ZEST 的賭注是:這些逐技能的鷹架幾乎全都不必要。由 Jean Pierre Sleiman、He Li、Scott Kuindersma、Farbod Farshidian 等作者提出的這套框架,接受來自三種異質來源的動作參考——高解析度動作捕捉、帶雜訊的單眼影片、以及從頭到尾不受物理約束的動畫——並訓練強化學習策略在硬體上追蹤這些參考。關鍵在於,系統避開了接觸標註、參考軌跡或觀測視窗、狀態估測器與大幅度的獎勵塑形——這四樣正是讓動作模仿管線變成「一技一工程」的拐杖。
讓它奏效的兩個關鍵機制
訓練迴圈內有兩個機制扛下了最重的工作。第一是自適應取樣(adaptive sampling):持續找出動作片段中最困難的部分——例如地板舞者重心移到單手的瞬間——並把訓練運算集中於此,而不是浪費在軌跡中簡單的八成片段上。第二是以模型輔助力矩(model-based assistive wrench)構成的自動課程:訓練初期,模擬器悄悄施加外力,協助機器人完成它還做不到的動作,隨著策略進步再逐步撤除輔助。兩者相加,讓單一訓練配方就能帶著策略走過動態、長時程的動作——這些過去必須靠人工分階段設計課程的難關。
論文在致動器建模上也有貢獻,而這正是 sim-to-real 研究常常草草帶過的部分。ZEST 包含一個改良的致動器模型,以及一套從閉鏈致動器的近似解析電樞值選擇關節層級增益的程序——Atlas 四肢那種並聯連桿關節正是這一類。在模擬中把致動器動力學建模正確並不光鮮,卻是零樣本部署成敗的一大關鍵;一個學會利用錯誤建模致動器的策略,第一次碰到真實硬體時就會發現落差。適度的域隨機化(domain randomization)——訓練時變動物理參數、延遲與感測器雜訊——補完了整套配方,讓策略對模擬器與實機之間的差距具備韌性,又不至於因極端隨機化而犧牲最終效能。
人類動作與機器動作之間的可擴充介面
作者在結論中提出的框架定位值得留意:他們主張 ZEST 建立了「生物運動與其機器對應物之間的可擴充介面」。這個主張比一份特技清單所暗示的更大。如果任何的人類動作——無論來自動捕、YouTube 影片一瞥、還是動畫師的關鍵影格——都能透過同一條管線變成機器人技能,那麼機器人行為的供給量就不再受限於機器人工程師的工時,而是受限於人類動作的整體語料。換句話說:實際上沒有上限。
產業脈絡讓這個時間點格外有意思。2026 年 5 月,Boston Dynamics 才發佈文章說明如何用強化學習訓練 Atlas 從事搬運重物等粗重工業工作,讓它以單一學習系統協調全身。ZEST 正是那套計畫的互補另一半:一個把新技能通用匯入平台的進口。而在專刊出版的同一週,北京的世界人形機器人運動會上有超過兩千台人形機器人同場競技——賽事中那些爆紅的摔倒片段,恰恰示範了示範與部署之間的韌性落差,也正是 ZEST 這類框架想關閉的缺口。
專刊內部的整體圖像
ZEST 是這期人形專題的封面論文,而整期內容讀起來就像這個領域現階段議程的快照。同期刊出的還有把動作追蹤「超級放大」以實現自然全身控制的 SONIC、回顧人形移動控制演進的綜述、主張實體 AI 是由機械硬體(而不只是學習演算法)所支撐的觀點文章,以及以視覺驅動的人形足球反應技能研究。集體訊息相當一致:在軟體吃掉機器人示範影片十年之後,前沿已經移往讓全身、高接觸的行為變得日常化——可重現、可轉移、且只要有動作資料就能訓練。
對實務工作者而言,可帶走的結論很具體。參考資料不必乾淨:單眼影片就足以支撐一整類表達性與場景互動技能。形態不必與來源相符:為卡通角色製作的動畫可以轉移到四足機器人上。部署也不必循序漸進:有了自適應取樣、輔助力矩課程與誠實的致動器模型,模擬訓練的策略可以直接冷啟動上機。每項技能花費的工程師·月,或許終於要走入歷史——而從一月就放上 arXiv 的預印本(2602.00401),任何人都可以去驗算數學。
Sources
- [1] https://www.science.org/doi/10.1126/scirobotics.aec7695
- [2] https://arxiv.org/abs/2602.00401
- [3] https://www.science.org/toc/scirobotics/11/117
- [4] https://interestingengineering.com/ai-robotics/humanoid-robot-master-complex-movements
- [5] https://robotharbour.com/zest-robot-skills-simulation-hardware/
- [6] https://www.dongascience.com/en/news/79408
- [7] https://bostondynamics.com/blog/training-a-humanoid-robot-for-hard-work/