← All posts / Research

NavMCP:把視覺語言模型與導航基礎模型鷹架成實體世界代理,任務越長優勢越大

上海交大、阿里 Qwen 團隊與北京大學的新論文,透過意圖、觀測、記憶三個協定通道將 VLM 推理代理與導航基礎模型執行器耦合——在 Unitree Go2 上達成 78.3% 成功率,且領先幅度隨任務視野拉長從 10 分一路擴大到 45 分。

NavMCP:把視覺語言模型與導航基礎模型鷹架成實體世界代理,任務越長優勢越大

NavMCP 新論文裡最重要的數字,不是機器人在真實多房間搜索中繳出的 78.3% 成功率,而是這個數字背後那條曲線的形狀:隨著任務變長,NavMCP 對最強基線的領先幅度不減反增——單房間任務領先 10 分、跨房間任務領先 25 分、超過 20 公尺的搜索領先 45 分。在代理效能通常隨視野(horizon)拉長而衰退的領域裡,這個反轉就是整篇論文的故事。

這篇論文《Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation》(將基礎模型鷹架化為實體世界代理,推進長視野導航的前沿)於 8 月 31 日以編號 2608.30396 登上 arXiv,團隊橫跨上海交通大學、阿里巴巴 Qwen 團隊、北京大學、清華大學、中關村學院與阿得雷德大學。9 月 1 日它登上 Hugging Face 每日論文頁,並被 AI Weekly 的編輯掃描選為當日最重要的研究訊號之一。

問題:兩種各擁一半技能、卻無法組合的模型

長視野的實體世界代理需要兩種能力,而今天的基礎模型恰好各提供一半。視覺語言模型(VLM)擅長推理那一半:推斷缺少什麼資訊、拆解遠程目標、動態調整高層計畫。但要 VLM 反覆把計畫落實成底層動作,既脆弱又沒效率——每個路徑點都變成一次推理步驟,誤差在數百個步驟中不斷累積。

導航基礎模型(NFM)——涵蓋 Uni-NaVid、NavFoM、ABot-N0/N1、SAME 與阿里巴巴自家的 Qwen-RobotNav 這一類模型——解決的正是互補的另一半。它們將自我中心觀測直接映射為閉環運動,穩健地執行語義目標,並能零樣本轉移到新環境。但它們以有界片段(bounded episode)運作:呼叫一次、導航一次、回傳一次,各次呼叫之間沒有持續的任務級推理。

最直覺的解法——讓 VLM 把 NFM 當工具呼叫——恰恰是論文證明行不通的做法。在作者所稱的「片段式工具介面」(episodic tool interface)下,代理送出一條導航指令,只收回終端狀態旗標與最終觀測。這造成三個被明確命名的缺口:指令與意圖錯配(路徑級指令無法表達代理的證據需求、搜索模式或預算)、中間觀測流失(沿途瞥見的有用證據——走廊上經過的物件、門縫裡看到的房間——全被丟棄)、以及跨呼叫記憶缺失(查過的區域與否定性發現在兩次呼叫之間蒸發)。

方法:三個通道,零重新訓練

NavMCP——這個名字意在把 NFM 當成受協定治理的結構化資源,而非不透明的工具呼叫——將代理與執行器之間的介面形式化為三個通道:

  • 意圖(Intent):把代理的證據需求翻譯成語義導航呼叫,讓 VLM 指定要找什麼、怎麼找(指令跟隨或物件導向搜索),而不必微管理底層控制。
  • 觀測(Observation):把每次完整的導航過程轉換成有來源依據的旅程證據——關鍵帧、顯著觀測、不確定性註記與未探索區域線索——而非單一終端快照。
  • 記憶(Memory):跨呼叫累積發現、否定性證據與未解目標,讓後續回合能依賴「廚房已查過:找到微波爐與烤麵包機;未見咖啡機」這類筆記,而不是從最新視角重新推導整個世界。

關鍵在於:兩個基礎模型都不需要重新訓練。這套框架是純粹的鷹架(scaffolding)——NFM 延伸了 VLM 的動作視野,VLM 代理延伸了 NFM 的推理視野。在論文的嵌入式問答(EQA)實作中,記憶通道實現為帶筆記本元件的證據帳本(evidence ledger):代理只有在其回答獲得當前觀測、旅程工件、已審關鍵帧或筆記條目支撐時才能作答,肯定答案必須引用看到什麼、在哪裡看到,否定答案則要有涵蓋可能位置的搜索區域紀錄背書。

數字

在 HM-EQA 嵌入式問答基準上,於匹配的全系統比較中(相同 Qwen3.5-397B-A17B 代理、相同片段、相同預算),NavMCP 搭配 8B 的 Qwen-RobotNav 執行器達到 74.0% 準確率——對比 FAST-EQA 的 63.5%、ToolEQA 的 60.8% 與 Explore-EQA 的 57.6%。在代理與執行器固定的情況下,把片段式介面換成 NavMCP 協定會差 14.9 分——這是對「結構化鷹架本身價值」的直接測量。

消融實驗把增益拆解開來:意圖通道限制成單一導航模式損失 2.0 分;只回傳終端觀測損失 5.9 分;拿掉旅程分析損失 4.4 分;移除 EQA 上下文狀態(記憶)損失 4.6 分。架構掃描則顯示真正的互補性——執行器固定時,準確率從無代理的 38.2% 爬升到完整代理的 74.0%;代理固定時,把隨機漫步執行器換成 Qwen-RobotNav-8B 從 60.9% 爬升到 74.0%。

真實機器人實驗是全文最有說服力的部分。在 Unitree Go2 四足機器人上,所有方法固定使用 Qwen3.6-Plus 骨幹、每個難度層級 20 個片段:NavMCP 在單房間搜索拿到 90%、跨房間搜索 85%、超過 20 公尺的搜索 60%——整體成功率 78.3%。反應式學習導航器基線從單房間的 80% 崩潰到 20 公尺以上的 0%(整體 38.3%);在 NavMCP 編排下的邊界探索(frontier exploration)執行器則落在 48.3%。安全協定方面:Go2 的局部避障系統全程開啟,逾時限制依難度設為 5/10/15 分鐘。由於實體實驗成本高昂,團隊將範圍設定在模擬到真實的轉移驗證,而非重跑完整的消融矩陣。

為什麼重要

這個結果落在了一場正在進行的路線之爭中間:實體世界代理到底該怎麼做?一派訓練端到端的視覺-語言-動作模型;另一派把 VLM 包進臨時拼湊的工具呼叫迴圈。NavMCP 標舉第三個位置:推理器與執行器之間的介面本身就是設計面——一個規格良好的協定(更豐富的意圖、有據可查的觀測、持續的記憶)在零訓練成本下,價值可以超過任何一個元件的原始能力。

這裡有一個熟悉的呼應。在軟體代理世界,Anthropic 的 Model Context Protocol 把臨時的工具整合變成標準化、可檢視的介面,如今每月下載量達 4 億次。NavMCP 把同樣的架構直覺應用到實體代理上:讓執行器呼叫變得可控、可檢視、可持續,孤立的導航片段就變成可複用的具身經驗。這個名字不是巧合。

論文的限制章節對範圍很誠實:這是一個任務家族(證據搜索導航與 EQA)、一個機器人平台,而且協定的超參數——50 個代理回合、每次呼叫 64 步、60,000 token 上下文壓縮、每次呼叫 16 個關鍵帧——是在基準套件上調校的。三通道協定能否在機械操作、多機器人車隊或真正開放世界的探索中存活,屬於未來工作。

但核心發現的適用範圍遠超機器人學:在長視野任務上,瓶頸往往不是模型能力,而是連接各項能力的協定。正在打造電腦操作代理、實驗室自動化或野外機器人的團隊,會立刻認出「片段式介面」這個失敗模式——而 NavMCP 是迄今最乾淨、已公開發表的修正藍圖。