一個模型、五種身體:Odyssey-3 同時學會開車、操控人形機器人與暢玩 GTA V
由自駕老兵創立、獲 Amazon 投資的世界模型公司 Odyssey 發布 Odyssey-3——單一自迴歸擴散Transformer,僅需數小時的任務資料就能控制機械手臂、人形機器人、汽車、無人機與遊戲代理,甚至展現出跨遊戲、無需重新訓練的技能遷移。
過去一年最令人驚豔的 AI 展示,幾乎都有一個共同形態:一套針對單一任務訓練的專用策略,吃下數千小時的窄域示範資料,然後在一個特定環境裡做好一件事。上週,一家名為 Odyssey 的帕羅奧圖新創低調發布了一份研究公告,主張恰恰相反的路線——而且用世界模型領域罕見的東西來背書:橫跨五種完全不同機器的可用成果。
Odyssey-3 由創辦人 Oliver Cameron 與 Jeff Hawke 於 9 月 15 日發布,是一個基礎世界模型(foundation world model)——以海量視覺觀測資料訓練的單一自迴歸擴散Transformer(autoregressive diffusion transformer)。公司宣稱,同一個模型可以驅動機械手臂、人形機器人、車輛、無人機、AI 訓練環境,甚至電動遊戲代理。不是五個模型共用一套程式碼,而是一個模型、五種身體。
賭注:通才勝過蠻力
Cameron 與 Hawke 從 2010 年代就投入自駕車與機器人研究,親眼看著這個領域喊了多年的「通用物理智能」,最終蓋出來的卻是愈來愈專門化的系統——每一套都得吞下巨量的任務專屬資料。Odyssey 直言,今日的機器人研究多半是在「蠻力硬解問題」:用更多的窄域示範資料,來彌補對世界的一般性理解不足。
公告裡的人類對比說得很明白:一個 18 歲的人第一次碰到危險機具也能操作,因為一輩子觀察空間、運動、受力與工具使用的經驗,早已補齊了直覺。真正的物理代理(physical agent),Odyssey 主張,應該要對世界的物理、動力學與因果關係具備超凡的理解——然後用跟人差不多、甚至更少的經驗資料,適應任何新任務。
Odyssey-3 就是這條路線存在的證據。機制上,它靠一個「動作解碼器」(action decoder)——接在世界模型之後的學習式輸出元件——把模型的內部表徵翻譯成特定機器所需的動作。共享骨幹只需在世界的視覺觀測上訓練一次,之後每個任務只掛上又小又便宜的解碼器。
這個模型實際做了什麼
機械手臂。 僅用數十小時的示範資料,Odyssey-3 學會控制多款機械手臂執行家務——把麥片倒進碗裡、把物品裝箱、用濕巾擦盤子。比成功案例更有意思的,是資料裡沒教過、卻自己冒出來的「復前行為」:抓取失誤後重新調整夾爪角度、撿起以奇怪姿勢掉落的物件。這代表模型是在用物理理解即興應變,而不是重播記憶中的軌跡。
人形機器人。 Odyssey 同步宣布與 Flexion 展開深度研究合作——這是一家專精強化學習與全身控制的通用機器人智能公司。以 Odyssey-3 為基礎模型,Flexion 僅用數十小時的遙操作資料,就讓人形機器人即時執行任務。在雙方的評測中,這些策略對環境變化的泛化能力優於受測的 VLA 基線——當光線變化讓基線策略失靈時,它們仍能繼續執行任務。
開車。 僅用 20 小時的模擬駕駛資料,一個由凍結世界模型視覺表徵餵養的小型策略,就能在印度的街道上閉環自駕、即時生成軌跡。在干擾頻繁的繁忙道路上,完全在模擬中訓練的策略,兩次安全員介入之間的平均行駛距離達到真實資料訓練版本的約 77%。這個數字才是真正的隱形頭條:真實駕駛資料的大部分價值,被「預訓練世界模型 + 廉價模擬」取代了。
無人機。 同一套配方——凍結骨幹、數十小時模擬飛行、一個把表徵轉為動作的行動專家——產生了能避障的穩定室內飛行。更引人注意的是:在權重完全凍結、沒有任何策略訓練的情況下,骨幹自己對空中導航的預測,就已經展現出合理的定向飛行與繞障運動。預訓練本身就編碼了空間結構。
電動遊戲。 用遊戲錄影加上鍵盤滑鼠輸入訓練出的策略,在 GTA V 中打出了包含駕駛、射擊與近身格鬥的長時間遊戲片段。接著是遷移成果:一個只用約兩小時 GTA 影片訓練的移動策略,在《碧血狂殺 2》(Red Dead Redemption 2)中產生了騎馬移動,在《Sleeping Dogs》中騎起了摩托車——兩款遊戲都沒有做任何額外訓練。在一個遊戲裡學會的技能,直接套用到不同的角色、載具與環境。
為什麼此刻特別有感
世界模型正處於資金熱潮,也處於誠實危機。Yann LeCun 的 AMI Labs 與李飛飞的 World Labs 合計募了巨額資金,卻刻意保持模糊——AMI 的世界模型副總裁對 TechCrunch 說「準備好談的時候自然會談」,連供應資料給他們的新創都說不清楚對方到底在做什麼。這個領域最接近「出貨」的產品是 World Labs 的 Marble,而 TechCrunch 的評價是:更像能力展示,而非產品。
在這個背景下,Odyssey-3 的罕見之處恰恰在於它攤開了成果:點名的合作者(人形機器人的 Flexion、跨機身基準測試的 Poke & Wiggle)、具體的資料量(數十小時、20 小時、兩小時)、可量化的基線(77% 這個數字、光線魯棒性比較)。公司對前沿的真實限制也不諱言——世界模型的規模仍落後語言模型約兩個數量級,因此 Odyssey 把 Odyssey-3 定位為「早期一瞥」,而非完成品。
資金背景同樣重要。Odyssey 在 2026 年 6 月以 14.5 億美元估值完成 3.1 億美元的 B 輪募資,由 Natural Capital 領投,Amazon、AMD Ventures 與 GV 跟投——英國《金融時報》的解讀是:Amazon 押注的是能模擬物理世界的模型。這輪募資讓總資金突破 3.37 億美元,給了這間實驗室追逐那條被業界忽略的規模化曲線的本錢。
值得盯住的遞迴迴路
公告裡埋著最前衛的主張:Odyssey-3 可以訓練 AI。它生成的環境可以讓學習中的代理住進去,形成公司所稱的「遞迴學習系統」——代理找出世界模型的缺陷、引導模型改進,而更可靠的世界模型又回頭提供更豐富的訓練素材。實驗室的 PROWL 框架以對抗方式探索這個循環,Agora-1 專案則把概念延伸到即時共享的多代理世界。
還有一個公司輕輕帶過、但意義深遠的安全面向:模擬世界提供了一個場所,讓危險的代理行為能在進入物理世界之前被發現、被研究後果——正好是本月 AI 新聞頭條那種失準自主行為的沙盒。
但書與後續觀察
這份公告是公司自己的研究文章,不是同行審查的論文;駕駛評測有安全員隨車;遊戲遷移成果被描述為「早期證據」。公開發布承諾在「未來幾週」——那才是真正的考驗:外部研究者實際把玩這個模型,Poke & Wiggle 的基準測試合作逐一檢視世界知識在哪裡遷移、在哪裡失效。
但這個主張的「形狀」本身就是新聞。機器人學花了十年,靠資料量把單一任務做到極致。Odyssey-3 押的是下一躍遷來自共享的物理理解——透過觀看世界學會一次、到處適用。從凍結骨幹配 20 小時駕駛資料,到兩小時遊戲影片就能跨遊戲遷移,這些早期數字至少說明了一件事:這個賭注,已經不再是個笑話了。
Sources
- [1] https://odyssey.systems/introducing-odyssey-3
- [2] https://www.techtimes.com/articles/327610/20260916/one-backbone-five-bodies-odyssey-3-drives-cars-runs-humanoids-plays-games.htm
- [3] https://techcrunch.com/2026/06/17/world-model-maker-odyssey-nabs-1-45b-valuation-backed-by-amazon-and-other-big-names/
- [4] https://techcrunch.com/2026/09/18/world-model-companies-are-keeping-a-lot-of-secrets/