不需要物理引擎:D-Robotics 的 Uranus 逐幀生成機器人模擬世界
一個完全繞過力矩積分的擴散模型——Uranus 把關節軌跡轉換成 24 FPS 的多視角影片,支援五種機器人形態、超過 2,400 小時的訓練資料。
每個機器人學習團隊最終都會撞上同一堵牆:物理模擬器跑起來便宜,畫面卻不夠真實;真實世界光澤逼真,做實驗的成本卻高昂到令人卻步。本週,D-Robotics AI Lab 發布了一份立場強硬的研究報告,選擇了一條激進的中間路線:視覺模擬乾脆不要物理引擎,讓擴散模型直接生成攝影機將會看到的畫面。
這套系統名為 Uranus,論文標題為《Uranus: Building the Next-Generation Simulation Infrastructure for Embodied AI》(arXiv:2609.24815,第 3 版於 2026 年 9 月 23 日上傳,由 Wenkang Qin 與 Yukun Zhou 領軍,團隊成員包括 Noah Shen、Jisong Cai、Dongxiao Mao、Baicheng Li、Yue Zhang 與 Wei Sui)。它於 9 月 24 日登上 Hugging Face 每日論文榜,隨即在具身智慧(embodied AI)社群中流傳開來。
Uranus 到底是什麼
Uranus 是一個以關節軌跡為條件的自迴歸擴散模型(joint-trajectory-conditioned autoregressive diffusion model)。它的輸入本身就說明了一切:初始的多視角觀測、校正過的攝影機內外部參數、以標準 MJCF 或 URDF 格式描述的機器人形態,以及以 qpos 表示的四個未來關節配置。輸出則是下一個同步的多視角觀測——如果機器人真的那樣移動,它的攝影機實際會看到的畫面。
每個自迴歸步驟生成一個潛在幀(latent frame),解碼為每台攝影機四張連續的 RGB 影格,且四個關節位置樣本與這四個時間戳一一對齊。由於生成的觀測會被回饋為下一步預測的上下文,整個模擬沒有固定的視界(horizon):可以一小段、一小段地無限開放式推進。經過推論優化——包括分離式 DiT 與 VAE 解碼、以及以 KV 快取為核心的狀態持久化——團隊報告的生成速度達到 24 FPS。
與傳統模擬器的對比是架構層面的,而非漸進改良。物理引擎沿時間向前積分力矩、速度與接觸力,再把結果渲染出來;Uranus 完全不做積分,它從資料中學習運動學軌跡的視覺後果。這意味著:接觸豐富的場景、變形、雜亂背景,只要出現在訓練語料中就免費附贈;沒出現過的,就會出錯。這個取捨正是整個賭注所在。
以 2,400 小時以上的真實機器人資料訓練
訓練語料集結了 AgiBot World Beta(141,355 個片段、2.574 億影格、30 FPS 下約 2,383 小時)、AgiBot World 2026、DROID,以及 RoboChallenge Table30 v1 與 v2——涵蓋單臂、雙臂與人形平台。為了在不更動模型架構的前提下吃下這種多樣性,Uranus 把形態特定的運動學與學習到的表徵解耦:每種機器人機體——UR5、ALOHA、AGIBOT、ARX5 或 DROID——都透過線上正向運動學與攝影機投影,轉換成共用的影像空間骨架表示。末端執行器標記直接編碼任務相關資訊:半徑代表夾爪開合程度,顏色由末端執行器與攝影機相對姿態的球諧函數計算而得。
真正重要的數字
三條評測主線值得注意:
長時域穩定性。 在 WorldOlympiad 長時域互動基準上,作者量測長時間推演後的衰減程度。在最後 140–160 秒區間,Uranus 在頭部視角維持約 12.3 PSNR 與 0.45 SSIM,而最接近的同期對比 GE-Sim 2.0 為 7.1 PSNR 與 0.20 SSIM。所有生成式模擬器都會隨誤差累積而衰減;這裡的主張是 Uranus 衰減得更慢。
任務 OOD 協議。 有鑑於社群日益擔憂具身智慧基準偷偷在測試集上訓練,作者把 30 項任務拆成 24 項訓練、6 項留出評測,並指定測試案例,同時報告分布內與分布外(OOD)結果。質性的 OOD 分析涵蓋對未見場景、軌跡、任務、攝影機運動與機器人形態的泛化。
閉環策略一致性。 或許最關鍵的實驗,是驗證 Uranus 能否充當策略評估器:多個策略分別在 Uranus 內與 RoboTwin 乾淨環境中閉環執行,再逐策略比較兩邊的平均成功率。如果模擬成功率能排序真實成功率,學習式模擬器就成了硬體試驗的廉價代理——這正是機器人學家願意付錢的使用場景。
##看清細節
論文對短板異常坦白。作者明確指出,在嚴峻的分布偏移下,精確接觸動力學與物體狀態轉移仍是限制所在——而這恰恰是物理引擎靠構造就能保證的性質。報告沒有發布「在 Uranus 中訓練的策略」對決「在物理模擬器中訓練的策略」的勝率數字,而這正是整個領域還在等待的遷移實驗。arXiv 的版本歷史本身就是一齣小戲碼:第 1 版 9 月 21 日上線,第 2 版隔天撤回,第 3 版在 9 月 23 日回復了完整的 20 MB 論文。
釋出內容包含程式碼與模型權重——這正是「基礎設施主張」與「演示影片」之間的分水嶺。
為什麼此刻重要
Uranus 出現在學習式世界模型熱鬧的一週——Black Forest Labs 同週釋出了開放權重的 FLUX 3 Action,論文本身也提及觸及同一技術棧的同期工作。共同方向無可誤認:如果影片生成模型能在互動幀率下預測下一步會發生什麼,機器人學習的瓶頸就會從「收集真實資料」轉移到「信任生成資料」。Uranus 這類學習式模擬器,押注的正是那份信任終將到來。
論文結尾自己提出的開放問題是:在生成影格上訓練的策略,遷移到真實硬體的成功率,是否足以取代至少一部分物理引擎管線。在第三方跑出那場正面對決之前,24 FPS 只證明 Uranus 能串流——不證明它能模擬。但作為模擬基礎設施走向的宣言,這是迄今最清晰的成果之一。