← All posts / Models

World Labs 發表 Atlas:能夠生成、重建與模擬任何世界的全模態世界模型

李飛飛創辦的 World Labs 於 9 月 1 日推出 Atlas——一個從零預訓練的多模態自回歸擴散 Transformer,原生支援文字、影像、影片與 3D,可生成長達一分鐘的 1440p 影片,並在 3D 重建任務上擊敗專用模型。

World Labs 發表 Atlas:能夠生成、重建與模擬任何世界的全模態世界模型

2026 年 9 月 1 日,由 AI 先驅李飛飛(Fei-Fei Li)創辦的空間智慧公司 World Labs,正式揭曉了新一代「全模態世界模型」Atlas。大型語言模型預測下一個 token,影片模型預測下一格畫面,而 Atlas 的目標更為宏大:在一個統一架構下原生跨越文字、影像、影片與 3D,去生成、重建與模擬整個世界。

這是該公司自 2024 年 12 月首次展示「單張照片生成 3D 世界」以來最重要的研究里程碑,也正值「世界模型」成為 AI 領域最激烈的戰場之一。World Labs 於 2026 年 2 月完成 10 億美元融資(其中 2 億美元來自 Autodesk),收購了機器人模擬新創 SceniX,並於 2025 年底推出首款商業化產品 Marble。該公司表示,Atlas「將驅動未來版本的 Marble 與其他產品」。

Atlas 究竟是什麼

在技術層面,Atlas 是一個從零預訓練的多模態自回歸擴散 Transformer,這三個詞各自承載著關鍵意義:

  • 多模態(Multimodal)——Atlas 原生處理文字、影像、相機姿態與 3D 深度圖,影片則表示為影像序列。最關鍵的是,每張影像與深度圖都以明確的相機姿態為條件,讓空間控制成為架構的一級公民,而非事後補上的外掛。
  • 自回歸(Autoregressive)——如同 LLM,它處理序列資料,一次生成一個輸出元素,並以先前的所有內容為條件。每種任務都只是另一種序列。
  • 擴散(Diffusion)——Atlas 是一個 rectified flow 模型,透過逐步去噪生成輸出,擅長處理高維度連續資料,並可在推論時透過調整去噪步數在速度與品質之間取捨。

貫穿全局的核心概念,是 World Labs 所稱的空間上下文(spatial context):所有輸入被整合進一個共享表徵,其中每張影像都錨定在 3D 空間中的特定位置。Atlas 據此生成「接下來的內容」,與所見的一切保持幾何一致——同時想像視野之外的世界。該公司指出,這個設計刻意從兩個世界取經:LLM 側的 KV 快取、快取感知路由與分離式服務,以及影片模型側的擴散蒸餾、classifier-free guidance、位移噪聲排程與現代 VAE 設計。

四大能力支柱

相機控制生成。 Atlas 從一張或多張參考影像出發,以「像素級精準」的相機控制生成影像與影片——相機幾何是原生輸入類型,而非「向左平移」這類粗糙的文字指令。輸出可達最長一分鐘的 1440p 影片。在一個令人印象深刻的示範中,模型僅憑一張照片就建構出完整可探索的場景,正確推斷出機器人的背面,並猜到泳池旁應該有一片草地。

空間重建。 Atlas 僅需一到三張輸入影像即可重建真實場景——不需要捕捉設備、不需要密集視角——同時產生新視角畫面與明確的 3D 輸出(點雲與 3D Gaussian splats)。輸入影像越多,它「想像」的成分就越少:給它上百張影像,它能如實重現完整的真實環境。在一個例子中,它用 2 到 25 張地面照片重建了史丹佛主校區(Main Quad),進而生成高空中飛越校園的鳥瞰路徑。

時空模擬。 Atlas 也是一個世界模擬器。視覺特效方面的亮點:只需三支架在腳架上的普通手機拍攝的片段,它就能凍結時間、從不可能的角度重新取景——等於把「子彈時間」攝影棚塞進一個後背包。機器人學方面的意義更大:用一段隨手拍攝的 24 格手機影片,Atlas 先把空間重建為 3D,再生成模擬機器人身載相機沿任意路徑行進時會觀察到的 RGB 與深度資料——還能改變物體、位置、光線與背景,大規模產生涵蓋剛體、關節與可變形物件的 Real-to-Sim 訓練資料。

影像生成。 雖非主要定位,Atlas 仍是能幹的影像生成器:能遵循複雜提示詞、渲染文字、生成 360° 全景,並橫跨多種視覺風格。

數據會說話

在相機控制生成方面,第三方人類評測員針對相同的輸入影像與相機路徑,對 Atlas 與各家領先影片模型進行頭對頭評比。結果一面倒:評測員偏好 Atlas 的比例,對上 MiniMax H3 為 75%、Gemini Omni Flash 為 81%、Happy Horse 1.1 為 86%、FLUX 3 為 93%、Seedance 2.5 為 94%——而且相機軌跡越複雜,Atlas 的優勢越大。

在稀疏視角 3D 重建方面,作為通才的 Atlas 以平均 25.3(×10⁻³) 的絕對相對點圖誤差,擊敗了最好的專用開源重建模型,領先 Pi3X 的 28.7、VGGT-Ω 1B 的 34.7、Depth Anything 3 的 36.4、π³ 的 39.3 與 MapAnything 的 47.7(七個標準基準平均)。逐資料集的勝績包括 DTU(8.6 對 11.1)、ETH3D(9.3 對 18.7)、ScanNet(12.4 對 15.7)與 7-Scenes(37.8 對 39.3)。

規模化才是重點

World Labs 同時發布了規模化證據:團隊訓練了一系列規模與訓練算力遞增的 Atlas 模型,發現「每一級新的算力都解鎖了新的模型能力」。該公司表示預期這個趨勢將隨著持續擴大規模而延續——這是一個明確的訊號:Atlas 是被設計來持續堆疊的地基,而非一次性的展示。

為什麼重要

在聊天機器人與編碼代理之後,世界模型已悄然成為 AI 熱潮的第三條戰線。機器人公司需要不必手工打造數位分身的模擬器;遊戲與電影工作室想要可控的世界生成;而企業級 3D 世界——CAD、BIM、數位孿生——正是 Autodesk 透過 World Labs 投入 2 億美元想切入的市場。

Atlas 的賭注在於:純 LLM 路線與純影片模型路線都無法獨自抵達終點。藉由讓相機姿態與深度成為原生輸入類型、把一切錨定在共享的空間上下文中,World Labs 主張:空間智慧——李飛飛長年倡導的命題——需要從第一層就為空間而設計的架構,而不是事後縫補。基準數字顯示,這個通才已經在專才自家遊戲中勝出——而這正是當年 LLM 吞噬 NLP 之前出現過的模式。

Atlas 現已透過早期存取計畫向特定合作夥伴開放,有興趣的團隊可向 World Labs 申请存取權限。如果規模化曲線繼續成立,今天的 Atlas 未來可能被視為一個轉捩點:世界模型從展示品變成基礎設施的那一刻。