← All posts / Research

不需要 VLA:Stanford HomeBody 讓 GPT Astra 直接透過技能庫操控人形機器人

Stanford 運動實驗室(TML)完全捨棄了需要訓練的視覺-語言-動作(VLA)中間層:GPT Astra 搭配持久空間記憶,就能驅動 Unitree G1 在從未見過的廚房裡完成長時程任務。

不需要 VLA:Stanford HomeBody 讓 GPT Astra 直接透過技能庫操控人形機器人

過去兩年,人形機器人自主操作的標準藍圖一直是三層架構:System 2 的視覺-語言模型(VLM)負責理解「該做什麼」,System 1 的視覺-語言-動作(VLA)學習策略負責把感知轉成指令,System 0 的全身控制器負責真正驅動硬體。Stanford 運動實驗室(The Movement Lab, TML)與一位 Caltech 合作者現在發表了一個系統,直接提出一個尖銳的問題:當前沿 VLM 已經夠強,中間那層到底還需不需要存在?

他們的答案是 HomeBody——一套把 GPT Astra(OpenAI 的前沿多模態模型)透過五個可組合的運動技能庫直接接入 Unitree G1 的人形機器人系統,完全繞過了需要訓練的 VLA 策略層。在一間機器人從未見過的廚房裡,G1 能夠來回多次整理房間,還能根據使用者模糊的描述找回一件先前看過的物品——全程不需要任何針對該環境的訓練資料,也不需要額外的策略學習。

HomeBody 實際做了什麼

展示任務聽起來很日常,而這正是重點。第一個任務中,機器人收到的指令是:「把所有咖啡包收拾好放到中間,過期的牛奶和果汁紙盒全部丟掉。」這需要判斷哪些該留、哪些該丟,繞著中島走動,抓取不同大小的物品,並協調多次來回——一個真正長時程、導航與操作交錯的任務序列。

第二個任務的難度藏得更深。「我忘記帶藥了,可以幫我拿一下嗎?順便把壞掉的紙盒丟掉。」藥品一開始根本不在視野內。HomeBody 必須記得探索時看過某個抽屜,走過去,用右手拉開抽屜、取出藥瓶交給主人,再用左手丟掉壞掉的紙盒。在兩隻手臂之間切換,讓機器人能夠觸及身體兩側的目標——這種全身協調能力,過去被視為學習式 VLA 架構的專利。

由機器人自己建立持久空間記憶

關鍵使能者是一套三階段部署流程。第一階段是探索:告訴人形機器人「你是廚房機器人,請探索這個空間!」然後放它自由行動。在這個階段它收集 0.5 倍速的 iPhone 影片、Intel RealSense D435i 相機觀測、經 SLAM 處理的 LiDAR 掃描、關節姿態,以及由 Astra 自己選擇的路徑點。關鍵在於,探索是從機器人自己的視角捕捉房間——空間脈絡奠基於機器真正看得到、構得到的東西,而不是人類錄製的導覽影片。

第二階段是 Real2Sim:Astra 擔任重建代理人,用機器人自己收集的資料在 NVIDIA Isaac Sim 中建立房間的數位孿生。專案 FAQ 對此異常坦白——人類錄製的影片提供了豐富的視覺細節,但機器人還需要精確的幾何資訊才能導航、定位、伸手取物。HomeBody 在相機觀測之外還餵給重建代理人實測的 SLAM 幾何,產生一個在幾何與語意上都準確的孿生。部署時,G1 用 Super Odometry 在這個共享座標系中定位,SLAM 地圖透過迭代最近點(ICP)配準對齊到重建場景。自我視角相機的觀測連同描述性內容存在同一座標系裡,所以即使物品離開視野,機器人仍能回到記錄過的位置。

第三階段才是任務本身:Astra 接收指令,自行決定去哪裡、對什麼採取行動——沒有任何動作層級的腳本。

架構:用工具呼叫取代動作 token

在底層,HomeBody 用一個即插即用的介面取代了學習式動作管線,長得非常像當代的 agent 工具呼叫。VLM 根據當前自我視角畫面、地圖脈絡、夾爪狀態、回憶起的觀測和上一次執行結果,選擇一個技能和一個空間目標——然後透過結構化工具呼叫傳遞出去。技能負責規劃並執行動作;VLM 永遠不需要知道技能的底層實作。

五個技能——取物(pick)、放置(place)、開抽屜、從抽屜取物、導航——共用統一的目標與執行結果介面,這正是 VLM 能在部署時自由組合它們的原因。每個技能底下都藏著相當扎實的傳統機器人技術:一次取物呼叫指定一個影像座標點(正規化到 0–1000)和使用哪隻手;這個點驅動 SAM 2.1 分割(搭配 SAMURAI 記憶選擇),Fast-FoundationStereo 從立體影像估計深度,相機標定把遮罩後的幾何投影到 3D,抓取姿態則用解析方法預測。手臂運動採用最小急動度(minimum-jerk)樣條參考軌跡,沿路徑解逆運動學並做掃掠碰撞檢查。

錯誤恢復刻意分層。若目標在接近過程中於畫面裡移動,基於追蹤輸出的視覺伺服會直接修正對齊,不必打擾 VLM。若一次抓取撲了空,取物技能會換下一個候選或調整站姿——有界的局部重試。只有當重試額度耗盡,技能才把失敗原因回報給 VLM,由它重新定位、換目標,或乾脆改變計畫。行走與操作則透過預訓練的 AMO 上半身感知下半身控制來協調,手臂與手部指令跑在 250 Hz,AMO 策略每五個控制週期更新一次(50 Hz)。

最引人注目的工程事實或許是:整套本地堆疊——技能、感知、運動規劃——跑在一台搭載 RTX 4090 的 Razer Blade 筆電上。Astra 在遠端執行,把技能請求傳下來、接收執行結果傳回去。

為什麼跳過 VLA 層很重要

「VLA 可有可無」這個主張值得推敲而非吹捧。學習式 VLA 策略(π0、RT-2、RDT 這個譜系)擅長低階靈巧操作與富接觸任務,那是五個參數化技能庫覆蓋不了的範圍——HomeBody 自己的限制章節也從另一個方向承認了這點。HomeBody 真正展示的是:對一類具體且經濟上重要的任務——由中等粒度原語構成、長時程、多物件、全屋的家務——一個具備持久空間記憶、精確定位和設計良好技能介面的前沿 VLM,今天就能在零訓練的前提下勝任。

取捨是真實的:Real2Sim 重建會增加每個環境的設置時間與 API 成本;任務長度受限於硬體續航(論文明確提到長時間操作時手指伺服器會過熱);Astra 的推理延遲也會在技能之間造成停頓。技能本身同樣是固定的——不過願景是:新技能無論是學習式策略還是傳統演算法,都能透過共用介面加入,並立即被 VLM 組合運用。

話雖如此,時機才是這件事超越學術展示的原因。這篇論文發表的一週,正好是新聞版面被 agent 框架、結構化工具呼叫與 agent 濫用事件洗版的一週——而 HomeBody 把同一套軟體範式直接搬到實體硬體上。如果前沿 VLM 繼續以目前的速度進步,學習式策略這個「中間層」最終可能被壓縮到堆疊底部需要高靈巧度的那一小段,而規劃、記憶與錯誤恢復則全部上移到任何人都 能按 token 租用的模型上。

程式碼已在 GitHub 開源,廚房場地由 Stanford 機器人中心提供。對一個花了兩年時間訓練越來越大動作模型的領域來說,一台筆電、一個機器人、一個被好好提示的前沿 VLM,是一份挑釁意味十足的精簡反提案。