← All posts / Models

無遙控、無腳本:宇樹 UnifoLM-X2-1.0 用即時世界模型驅動全自主人形機器人格鬥

宇樹科技宣稱 UnifoLM-X2-1.0 是首個以即時世界模型驅動全自主人形機器人格鬥的系統——沒有遙控、沒有預編排動作。深入解析這項宣告、WMA-0 的技術血統,以及尚待驗證的疑點。

無遙控、無腳本:宇樹 UnifoLM-X2-1.0 用即時世界模型驅動全自主人形機器人格鬥

9 月 7 日,宇樹科技(Unitree Robotics)發布了 UnifoLM-X2-1.0,並將其描述為第一個以即時世界模型驅動全自主人形機器人格鬥的系統——背後沒有人類操作員握著遙控器,沒有預先編排的腳本,也沒有事先規劃好的動作序列。如果這項宣稱成立,它將是具身 AI 的一個重要分水嶺:機器不再只是執行學習到的技能,而是持續預測物理世界接下來會發生什麼,並據此即時規劃行動——而且對手也在做同樣的事。

這個定位刻意充滿挑釁意味。格鬥並不是大多數機器人公司競爭的場域——真正的商業利益在倉庫、工廠,以及折衣服這類示範影片。但作為自主能力的壓力測試,格鬥接近最壞情況,而這正是這項發布即使在細節尚未公開之前,依然值得認真看待的原因。

世界模型在這裡到底做什麼?

在這個語境下,世界模型是一個能在內部模擬行動後果的神經網路。給定當前的視覺場景狀態與一個候選動作,它會預測物體將如何移動、力會如何交互作用、以及機器人自己的身體會如何回應。機器人不再只是對已經發生的事做出反應——古典控制迴路的思維——而是根據「即將發生什麼」的預測來行動。

宇樹將 X2-1.0 的發布框定為突破了以往世界-行動基礎模型的四大瓶頸:

  • 即時規劃——在動態交戰中夠快地產生可行動作。
  • 決策能力——面對會回應你每一步的移動式對抗性對手。
  • 動態互動執行——承受拳打腳踢等高強度接觸事件而不摔倒或當機。
  • 對未來狀態的即時預測,而非事後的反應式控制。

在示範影片中,一群宇樹人形機器人執行了武術套路、翻滾與高速交戰。該公司表示,系統會預測「未來幾秒的物理變化」,並在那個時間視野內完成規劃。

技術血統:一年前開源的 WMA-0

X2-1.0 並非憑空出現。2025 年 9 月,宇樹開源了 UnifoLM-WMA-0——其第一個橫跨多種機器人形態的世界-模型-行動架構。基礎模型至今仍可在 Hugging Face 上下載,訓練程式碼也放在 GitHub 上——這點很重要,因為它讓外部人得以具體檢視 X2-1.0 可能繼承的架構 DNA。

WMA-0 是一個帶有動作頭(action head)的視訊擴散世界模型,以 Open-X 加上五個宇樹自有資料集訓練而成。它以兩種模式運作:決策模式預測未來物理互動的資訊,協助控制策略產生動作;模擬模式則根據機器人的動作,產生高傳真的環境回饋。訓練分兩階段:先是視訊生成階段,之後是動作條件式的微調。

X2-1.0 看起來是這條路線的量產級演化:同樣是「在承諾一個動作之前先模擬未來」的核心思想,針對充滿接觸、對抗性強、對延遲毫不留情的場景進行強化。

為什麼格鬥才是誠實的基準

倉庫撿放任務是寬容的:物體不動、時間寬鬆、抓取失敗大不了重來一次。格鬥對手在每個軸线上都是相反的:接觸密集、對抗性強、連幾十毫秒的延遲都會受到懲罰。如果一個世界模型能在這個包絡線內有效規劃,同一套能力組合就指向一長串不那麼炫技、卻更具商業價值的應用:

  • 雙手操作會移動或會形變的物體——物件狀態會在動作執行過程中持續演變。
  • 人機協作完成共同任務——人類的動作無法預測。
  • 崎嶇或受擾動地形上的行走——預測問題本質相同,只是賭注不同。
  • 遙操作——目前往返延遲限制了性能極限;一個能「預測穿越延遲」的本地世界模型,等於把延遲藏了起來。

底層還有一個架構層面的故事。今天大多數人形機器人的技術堆疊是拼裝出來的:底層是學習出來的運動控制策略,上面疊一個 VLA 或 LLM 規劃器,中間再用手工打造的安全層黏合。一個能預測未來幾秒物理變化並直接驅動控制的單一世界模型,將會讓整個堆疊塌縮——接縫更少、失效模式更少、對未來只有一種表徵。X2-1.0 究竟是真正的統合架構,還是為了示範而切出來的一小片,這是最大的懸念。

缺的是什麼——而且不少

質疑者的清單並不短。沒有論文、沒有基準測試數據、沒有推論延遲數字,也沒有確認 X2-1.0 是否會像前代一樣開源。格鬥影片確實令人印象深刻,但光看影片無法判斷有多少是精挑細選的片段、模型如何應付陌生的對手與環境、失效模式長什麼樣子,或者要在機器人本體上以控制頻率跑這些預測需要多少運算資源。「全球第一」的新聞稿與「實驗室裡可重現」之間的鴻溝,正是機器人學發布消息最常葬身之處。

恰當的立場是有條件的相信:血統是真的、前作可供檢驗、示範與宣稱的能力相符——但目前的證據就只有一支影片和一句宣告。

宣告背後的公司

宇樹是帶著實質動能迎向這次發布的。公司由王興興於 2016 年在杭州創立,從四足機器人起家,之後跨入人形機器人領域,並一直強調垂直整合——核心零件自研自產——作為成本武器。G1 人形機器人售價約 16,000 至 18,000 美元,僅為西方競爭對手定價的一小部分。

截至 2026 年 7 月,宇樹已出貨超過 18,000 台人形機器人,而且已經獲利。2026 年 8 月在上海科創板上市,以超額認購的 IPO 募得約 9.05 億美元,王興興並表明募資所得的相當比例將投入 AI 模型研發。X2-1.0 是這筆支出的第一個高調成果——也是一個訊號:宇樹打算在模型層面競爭,而不只是靠硬體毛利。

後續觀察指標

對於在人形機器人平台上開發的人而言,關鍵問題是 X2-1.0(或其蒸餾版本)會不會登上 Hugging Face,與 WMA-0 及宇樹既有的 VLA 模型並列。權重可下載的那一刻,這就不再是一支行銷影片,而是社群可以微調、 benchmark、並且嘗試弄壞的東西。同時也留意第三方對「自主格鬥」宣稱的重現、延遲數據的揭露,以及 WMA-0 的雙模式架構是否延續到新系統中。

在那之前,UnifoLM-X2-1.0 最適合被解讀為一篇製作精良的論點陳述:通往實用人形機器人的道路,穿過的是對未來的預測,而不是對過去的反應——而第一個把這個想法工業化的公司,可能就是那家已經賣出 18,000 台機器人的公司。