NVIDIA Cosmos 3 Edge:把 4B 世界模型裝進每一台機器人
NVIDIA 開源的 40 億參數世界模型,能在邊緣 GPU 上即時完成感知、預測與動作生成——完全不需要雲端。
多年來,自主機器人的發展一直卡在一個頑固的瓶頸:最聰明的 AI 模型體積太大、耗電太高,且過度依賴雲端往返,根本無法在機器人本機上運行。2026 年 7 月的 SIGGRAPH 大會上,NVIDIA 徹底推翻了這個假設。他們發布了 Cosmos 3 Edge——一個 40 億參數的開源世界模型,將感知、推理、世界預測與機器人動作生成統整在單一架構中,專為完全在裝置端運行而設計,無需任何雲端連線。
這是第一次有前哨等級的世界模型以這樣的規模被封裝為邊緣版本,而且伴隨 NVIDIA 全新 Jetson Thor 運算模組的推出,讓從工廠機械臂到自駕車的各種部署場景都變得可行。
Cosmos 3 Edge 實際在做什麼?
Cosmos 3 Edge 是一個經後訓練的世界動作模型(World Action Model, WAM)——它不只理解或描述場景,而是實際生成機器人應該執行的物理動作序列。模型原生處理五種模態:文字、影像、視訊、環境音與動作指令。這種全模態設計意味著,過去需要分別由視覺、規劃與控制系統處理的任務,現在全部由單一網路完成。
核心功能是即時執行三件事:
- 場景理解——以 640×360 解析度擷取即時攝影機影像,建構環境的豐富語意與空間表徵。
- 世界預測——模擬接下來會發生什麼,生成未來畫面並預測物體與代理的移動方式。
- 動作生成——每次推論輸出 32 個離散動作,直接驅動機械手臂、輪子或其他致動器。
最終成果是一個緊密的 15 Hz 控制迴圈——足以實現流暢的即時機器人操作——而且完全在邊緣硬體上運行。一台配備 Cosmos 3 Edge 與 Jetson Thor 模組的機器人,可以感知一張雜亂的桌面、預測物體可能的位移,然後伸向目標物品——完全不需要呼叫資料中心。
基於 Nemotron 打造,為邊緣優化
Cosmos 3 Edge 繼承自更廣泛的 Cosmos 3 家族——NVIDIA 於 2026 年 5 月推出的首個完全開放物理 AI 全模態模型。完整的 Cosmos 3 架構在 arXiv 論文(2606.02800)中被描述為一系列全模態世界模型,能夠聯合處理與生成語言、影像、視訊、音訊與動作。
Edge 版本是在此基礎上蒸餾與優化的 40 億參數配置,建構於 NVIDIA Nemotron 基礎之上,專為記憶體效率部署而調校。它鎖定全新的 Jetson Thor SoC 系列——NVIDIA 最新邊緣機器人平台,搭載 Blackwell GPU,提供高達 2,070 FP4 TFLOPS(稀疏)運算力與 96 個第五代 Tensor Core。在配備 32 GB LPDDR5X 記憶體、273 GB/s 頻寬的 Jetson T3000 模組上,Cosmos 3 Edge 實現完整的即時運行。較低功耗的 T2000 模組(400 FP4 TFLOPS)也支援同一模型,只是吞吐量略低。
關鍵在於,這個模型在 NVIDIA RTX 消費級 GPU、DGX 系統與雲端實例上同樣能跑——但它的決定性特徵是它根本不需要這些。邊緣原生設計才是重點。
開放權重,真正的可及性
或許最具影響力的決策是授權方式。NVIDIA 以開放模型授權在 Hugging Face(nvidia/Cosmos3-Edge)上發布 Cosmos 3 Edge,提供完整權重、推論程式碼,以及與 Hugging Face Diffusers 函式庫的整合。研究人員與企業可以自由下載、微調與部署。NVIDIA 同時開源了涵蓋機器人、物理模擬與駕駛場景的合成資料生成(SDG)資料集——這些是讓世界模型穩健運作的訓練基底。
這與其他前哨實驗室推出的封閉世界模型形成鮮明對比。當競爭者將物理 AI 鎖在 API 與使用費背後時,NVIDIA 押注的是開放生態——可下載的模型、開放資料、以及大眾化邊緣硬體——會比任何單一公司獨自推進更快地加速整個物理 AI 領域。
日本聯盟:工業機器人遇上 AI
這個模型並非孤立存在。在 SIGGRAPH 發布的數天前,NVIDIA 執行長黃仁勳飛往東京,帶回了一整套合作協議。日本的工業機器人巨頭——FANUC、安川電機、川崎重工與富士通——全部加入「NVIDIA Cosmos 聯盟」,共同打造開放前哨物理 AI 模型。Sony 與日立也表態支持。
這樣的搭配在戰略上顯而易見。日本擁有全球最先進的工業機器人製造基礎——光 FANUC 一家就在全球部署了超過 75 萬台工業機器人。NVIDIA 提供 AI 基礎架構。雙方合作,聯盟計畫在工廠、倉庫與自駕場景中部署搭載 Cosmos 3 Edge 的系統,FANUC 更明確鎖定語音控制機器人操作與 AI 代理驅動的製造產線。
富士通將此合作定位為「物理 AI 的社會實裝」,清楚傳達這些公司不把裝置端世界模型視為研究玩具,而是未來十年自動化基礎設施的部署就緒方案。
為什麼「邊緣優先」很重要
從雲端依賴轉向邊緣原生的機器人發展,其影響遠遠超出延遲問題:
- 可靠度。 一台能在斷網時持續推理的倉庫機器人,不會在 WiFi 斷線時突然失能。工廠樓層、礦坑、離岸平台——這些連線不穩定的環境——從此成為自主系統的可用場域。
- 隱私與安全。 裝置端推論意味著攝影機影像永遠不離開機器人。對於醫療、國防或敏感製造應用,這不是加分項而是先決條件。
- 成本。 以 15 Hz 頻率持續進行雲端推論來操作機器人,成本將高得令人卻步。邊緣部署把經常性的 API 費用轉化為一次性的硬體採購。
- 安全確定性。 即時控制迴圈要求可預測的延遲。邊緣硬體提供確定性時序;雲端往返辦不到。
基準與效能脈絡
NVIDIA 公布了 Cosmos 3 Edge 在 VANTAGE-Bench 上的成績——這是其物理 AI 世界模型基準測試套件,涵蓋感知準確度、預測視野,以及操作、導航與駕駛任務的動作成功率。在 Jetson Thor 硬體上,模型維持 15 Hz 控制迴圈的同時,每次推論完整生成 32 個動作序列——這樣的吞吐量讓每個控制週期都能規劃數步之後的操作。
作為對比,現有大多數視覺-語言-動作(VLA)模型在邊緣硬體上只能跑 1–3 Hz,或者需要雲端卸載才能達到可用頻率。Cosmos 3 Edge 在解析度、動作視野與頻率上的組合,代表了裝置端能力的一次實質飛躍。
更宏觀的圖像
Cosmos 3 Edge 不只是一次產品發布——它是一個宣言。NVIDIA 主張,AI 的下一個前哨不是雲端裡更大的語言模型,而是更小、更聰明、住在穿越物理世界的機器內部的模型。這個押注有開放權重、開放資料、大眾化邊緣硬體,以及與真正大量製造機器人的企業的產業結盟作為後盾。
無論 Cosmos 3 Edge 是否會成為事實標準,它已經重新劃定了邊界。2026 年剩餘時間裡的問題不再是世界模型能否在機器人上運行——NVIDIA 已經回答了。問題是業界其他玩家能多快跟上。
Sources
- [1] https://huggingface.co/blog/nvidia/cosmos3edge
- [2] https://www.nvidia.com/en-us/events/siggraph/
- [3] https://blogs.nvidia.com/blog/siggraph-news-2026/
- [4] https://blogs.nvidia.com/blog/jetson-thor-robotics-edge-ai-agent/
- [5] https://www.buildfastwithai.com/blogs/nvidia-cosmos-3-edge-complete-guide-2026
- [6] https://nvidianews.nvidia.com/news/japans-robotics-and-manufacturing-leaders-build-on-nvidia-cosmos-to-advance-physical-ai-frontier
- [7] https://arxiv.org/abs/2606.02800
- [8] https://www.techtimes.com/articles/321401/20260723/nvidia-siggraph-cosmos-3-edge-brings-physical-ai-pipeline-single-gpu.htm
- [9] https://developer.nvidia.com/blog/develop-physical-ai-reasoning-world-and-action-models-with-nvidia-cosmos-3/
- [10] https://www.reddit.com/r/machinelearningnews/comments/1v2bxwc/nvidia_releases_cosmos_3_edge_a_4bparameter_open/