← All posts / Models

NVIDIA Cosmos 3 Edge:把 4B 世界模型裝進每一台機器人

NVIDIA 開源的 40 億參數世界模型,能在邊緣 GPU 上即時完成感知、預測與動作生成——完全不需要雲端。

NVIDIA Cosmos 3 Edge:把 4B 世界模型裝進每一台機器人

多年來,自主機器人的發展一直卡在一個頑固的瓶頸:最聰明的 AI 模型體積太大、耗電太高,且過度依賴雲端往返,根本無法在機器人本機上運行。2026 年 7 月的 SIGGRAPH 大會上,NVIDIA 徹底推翻了這個假設。他們發布了 Cosmos 3 Edge——一個 40 億參數的開源世界模型,將感知、推理、世界預測與機器人動作生成統整在單一架構中,專為完全在裝置端運行而設計,無需任何雲端連線。

這是第一次有前哨等級的世界模型以這樣的規模被封裝為邊緣版本,而且伴隨 NVIDIA 全新 Jetson Thor 運算模組的推出,讓從工廠機械臂到自駕車的各種部署場景都變得可行。

Cosmos 3 Edge 實際在做什麼?

Cosmos 3 Edge 是一個經後訓練的世界動作模型(World Action Model, WAM)——它不只理解或描述場景,而是實際生成機器人應該執行的物理動作序列。模型原生處理五種模態:文字、影像、視訊、環境音與動作指令。這種全模態設計意味著,過去需要分別由視覺、規劃與控制系統處理的任務,現在全部由單一網路完成。

核心功能是即時執行三件事:

  1. 場景理解——以 640×360 解析度擷取即時攝影機影像,建構環境的豐富語意與空間表徵。
  2. 世界預測——模擬接下來會發生什麼,生成未來畫面並預測物體與代理的移動方式。
  3. 動作生成——每次推論輸出 32 個離散動作,直接驅動機械手臂、輪子或其他致動器。

最終成果是一個緊密的 15 Hz 控制迴圈——足以實現流暢的即時機器人操作——而且完全在邊緣硬體上運行。一台配備 Cosmos 3 Edge 與 Jetson Thor 模組的機器人,可以感知一張雜亂的桌面、預測物體可能的位移,然後伸向目標物品——完全不需要呼叫資料中心。

基於 Nemotron 打造,為邊緣優化

Cosmos 3 Edge 繼承自更廣泛的 Cosmos 3 家族——NVIDIA 於 2026 年 5 月推出的首個完全開放物理 AI 全模態模型。完整的 Cosmos 3 架構在 arXiv 論文(2606.02800)中被描述為一系列全模態世界模型,能夠聯合處理與生成語言、影像、視訊、音訊與動作。

Edge 版本是在此基礎上蒸餾與優化的 40 億參數配置,建構於 NVIDIA Nemotron 基礎之上,專為記憶體效率部署而調校。它鎖定全新的 Jetson Thor SoC 系列——NVIDIA 最新邊緣機器人平台,搭載 Blackwell GPU,提供高達 2,070 FP4 TFLOPS(稀疏)運算力與 96 個第五代 Tensor Core。在配備 32 GB LPDDR5X 記憶體、273 GB/s 頻寬的 Jetson T3000 模組上,Cosmos 3 Edge 實現完整的即時運行。較低功耗的 T2000 模組(400 FP4 TFLOPS)也支援同一模型,只是吞吐量略低。

關鍵在於,這個模型在 NVIDIA RTX 消費級 GPU、DGX 系統與雲端實例上同樣能跑——但它的決定性特徵是它根本不需要這些。邊緣原生設計才是重點。

開放權重,真正的可及性

或許最具影響力的決策是授權方式。NVIDIA 以開放模型授權在 Hugging Face(nvidia/Cosmos3-Edge)上發布 Cosmos 3 Edge,提供完整權重、推論程式碼,以及與 Hugging Face Diffusers 函式庫的整合。研究人員與企業可以自由下載、微調與部署。NVIDIA 同時開源了涵蓋機器人、物理模擬與駕駛場景的合成資料生成(SDG)資料集——這些是讓世界模型穩健運作的訓練基底。

這與其他前哨實驗室推出的封閉世界模型形成鮮明對比。當競爭者將物理 AI 鎖在 API 與使用費背後時,NVIDIA 押注的是開放生態——可下載的模型、開放資料、以及大眾化邊緣硬體——會比任何單一公司獨自推進更快地加速整個物理 AI 領域。

日本聯盟:工業機器人遇上 AI

這個模型並非孤立存在。在 SIGGRAPH 發布的數天前,NVIDIA 執行長黃仁勳飛往東京,帶回了一整套合作協議。日本的工業機器人巨頭——FANUC、安川電機、川崎重工與富士通——全部加入「NVIDIA Cosmos 聯盟」,共同打造開放前哨物理 AI 模型。Sony 與日立也表態支持。

這樣的搭配在戰略上顯而易見。日本擁有全球最先進的工業機器人製造基礎——光 FANUC 一家就在全球部署了超過 75 萬台工業機器人。NVIDIA 提供 AI 基礎架構。雙方合作,聯盟計畫在工廠、倉庫與自駕場景中部署搭載 Cosmos 3 Edge 的系統,FANUC 更明確鎖定語音控制機器人操作與 AI 代理驅動的製造產線。

富士通將此合作定位為「物理 AI 的社會實裝」,清楚傳達這些公司不把裝置端世界模型視為研究玩具,而是未來十年自動化基礎設施的部署就緒方案。

為什麼「邊緣優先」很重要

從雲端依賴轉向邊緣原生的機器人發展,其影響遠遠超出延遲問題:

  • 可靠度。 一台能在斷網時持續推理的倉庫機器人,不會在 WiFi 斷線時突然失能。工廠樓層、礦坑、離岸平台——這些連線不穩定的環境——從此成為自主系統的可用場域。
  • 隱私與安全。 裝置端推論意味著攝影機影像永遠不離開機器人。對於醫療、國防或敏感製造應用,這不是加分項而是先決條件。
  • 成本。 以 15 Hz 頻率持續進行雲端推論來操作機器人,成本將高得令人卻步。邊緣部署把經常性的 API 費用轉化為一次性的硬體採購。
  • 安全確定性。 即時控制迴圈要求可預測的延遲。邊緣硬體提供確定性時序;雲端往返辦不到。

基準與效能脈絡

NVIDIA 公布了 Cosmos 3 Edge 在 VANTAGE-Bench 上的成績——這是其物理 AI 世界模型基準測試套件,涵蓋感知準確度、預測視野,以及操作、導航與駕駛任務的動作成功率。在 Jetson Thor 硬體上,模型維持 15 Hz 控制迴圈的同時,每次推論完整生成 32 個動作序列——這樣的吞吐量讓每個控制週期都能規劃數步之後的操作。

作為對比,現有大多數視覺-語言-動作(VLA)模型在邊緣硬體上只能跑 1–3 Hz,或者需要雲端卸載才能達到可用頻率。Cosmos 3 Edge 在解析度、動作視野與頻率上的組合,代表了裝置端能力的一次實質飛躍。

更宏觀的圖像

Cosmos 3 Edge 不只是一次產品發布——它是一個宣言。NVIDIA 主張,AI 的下一個前哨不是雲端裡更大的語言模型,而是更小、更聰明、住在穿越物理世界的機器內部的模型。這個押注有開放權重、開放資料、大眾化邊緣硬體,以及與真正大量製造機器人的企業的產業結盟作為後盾。

無論 Cosmos 3 Edge 是否會成為事實標準,它已經重新劃定了邊界。2026 年剩餘時間裡的問題不再是世界模型能否在機器人上運行——NVIDIA 已經回答了。問題是業界其他玩家能多快跟上。