先寫程式、再凍結、後驗證:編碼代理在機器人規劃上擊敗傳統人工求解器
新論文顯示 Claude Code 與 Codex 代理能合成泛用型任務與運動規劃程式,在 98,000 次評估中以 56–95% 成功率勝過傳統規劃器的 47%。
將近十年來,「任務與運動規劃」(Task and Motion Planning,TAMP)一直是機器人學領域最頑強的難題之一。問題本身說起來很簡單:機器人必須同時決定「做什麼」(離散的動作序列)和「怎麼做」(符合物理的限制的連續幾何、運動學與動力學軌跡)。一個抓取放置任務,可能既要求選擇抓取順序,又要求保證機械臂全程不撞到桌面。離散與連續兩個層面緊密耦合,要聯合求解,傳統上得倚賴高度專業化的工程——PDDLStream 這類領域特定規劃器、手工調校的取樣器,再加上專家經年累月的迭代。
一篇 9 月 24 日發布於 arXiv 的新論文提出了一個直白的問題:這些手工工程,我們還需要嗎?在《Coding Agents for Generalized Task and Motion Planning Problems》中,由 Matteo Merler 與 Tom Silver 領銜的研究團隊,把 Claude Code(Opus 5)與 Codex(分別搭載 GPT-5.6 Sol 與 GPT-6 Astra)當作「泛用型 TAMP 規劃器」來評估——結果發現,代理們令人信服地超越了傳統技術棧。
實驗設計:合成的是程式,不是策略
這篇論文之所以可信,關鍵在實驗設計。每個編碼代理拿到任務描述與模擬器存取權後,在一個固定的合成預算內自由決定如何與環境互動、跑實驗、反覆迭代,最終產出一支程式。這支程式接著被凍結,拿到它從未見過的問題實例上評估。
這套「先寫、再凍結、後驗證」的流程,堵住了一般代理基準測試常見的灌水漏洞:代理無法在評估時臨場調整、無法背下測試案例、也沒有可以駭的獎勵訊號(獎勵只存在於開發階段)。泛化能力必須真正內建在合成出來的程式碼裡。
評估規模也夠大:取自 KinDER 與 PDDLStream 基準套件的 28 個模擬環境,物件數量還刻意超過原始基準的設計範圍。所有程式合成方法合計評估了 980 支生成的程式,每支在 100 個保留實例上測試——總共 98,000 次評估回合。
結果
核心數字:在三種代理配置下,平均成功率全部勝過人工工程規劃器,落在 56% 到 95%,而傳統規劃器為 47%(在有規劃器基線的 16 個環境上比較)。代理們也擊敗了一次性生成(完全不與環境互動、單輪寫出程式)以及一個基於 LLM 的泛化規劃基線。
兩個次要發現,重要性不亞於主結果:
- 規模化的韌性。 當物件數量超過原始基準範圍持續增加,代理程式維持的成功率仍高於傳統規劃器。TAMP 求解器在場景變擁擠時惡名昭彰地會組合爆炸;合成程式的效能退化明顯更平緩。
- 運算效率。 在評估階段,代理寫出的程式平均每個實例耗用的運算量比規劃器低約一個數量級。對實體機器人而言,規劃延遲直接決定手臂能動多快——這個差距,就是「展示影片」與「可出貨產品」的差別。
最有意思的證據其實在日誌裡。研究者報告,代理會把互動預算用來校正物理模型(根據模擬器回饋微調摩擦或抓取參數)、測試邊界情況(退化的物件擺位、近乎碰撞的構型),並在初始嘗試失敗時精進策略。換句話說,這些代理的行為不像文字產生器,而更像實驗學家——把機器人學研究生會跑的「假設—測試—除錯」循環,壓縮進一個自動化的合成預算裡。
為什麼此時此刻成真
這個結果出現的時間點,正好撞上機器人產業公開承認卡在這個問題上。正如本週報導,Tesla 的 Optimus 產線每週已能組裝數百台機器人,但其 AI 仍「無法可靠地處理廣泛任務」,基本行為要學上好幾天,精細操作又被硬體瓶頸卡住。硬體產能與任務泛化之間的落差,正是這篇論文所攻擊的泛化規劃缺口。
經濟面也解釋了時機。傳統 TAMP 的專業人才稀缺且昂貴——單一領域就可能吃掉一整篇博士論文。編碼代理則讓這種專業能力變成按小時租用。如果代理能在有限預算內為新環境合成出一支堪用、可重複使用的規劃程式,新增一個任務類別的邊際成本就崩落了。論文將編碼代理定位為「泛用型 TAMP 的強力基線」——「基線」是關鍵詞:從今以後,任何新方法都得先跟它比。
必須誠實面對的限制
持平地看,這篇論文沒有證明的事也得說清楚。全部 28 個環境都是完全可觀測、物件中心狀態表示的模擬——這是 TAMP 最乾淨的理想設定,離倉庫現場那種部分可觀測、感測器充滿雜訊的現實還很遠。56%–95% 的配置差距也意味著模型選擇與互動策略影響巨大——下限那一端仍有近半實例解不開。合成程式的模擬到實體轉移(sim-to-real)尚未驗證。而且,雖然合成預算是固定的,它本身並不便宜——評估階段的高效率,並未計入代理學習環境時燒掉的運算。
但這些是一部紮實實證研究正常的但書,而非否決條件。作者公開了全部程式碼,連給代理的完整提示詞都一併釋出——在一個代理管路往往「只聞樓梯響」的領域,這種可重製的姿態相當罕見。
更大的圖像
更深一層的意義在建築架構上。機器人學長年在兩極之間擺盪:手工工程的符號規劃(可解讀、但脆弱)與端到端學習的策略(有彈性、但黑箱)。這篇論文指向第三條路——代理合成的符號產物。代理在離線階段做緩慢昂貴的探索;上線的機器人跑的是一支快速、可檢視、凍結版本的程式。你同時拿到傳統規劃的可解讀性,與現代 LLM 的開發速度。
對編碼代理生態系而言,這又是下一個戰場——在競賽級數學、形式驗證、九圈物理計算之後——前沿模型裝進代理框架後,產出的人造物再次勝過人類專家的手工結晶。這個模式已經難以忽視:稀缺資源不再是「寫得出求解器的能力」,而是「知道哪些問題現在開口問就有答案」。