拒絕貝佐斯 20 億美元的創業家:Accelerated Understanding 發表跳過 Transformer 的物理 AI
Caltech 教授 Anima Anandkumar 放棄 Bezos 撐腰的 Prometheus 與逾 20 億美元融資承諾,自立門戶推出 Accelerated Understanding——以神經算子取代 Transformer、原生 4D 預測物理的 AI,號稱推理上下文達 5 兆數值。
2024 年底,在洛杉磯近郊一家高級餐廳的晚餐桌上,日後與 Jeff Bezos 共同創辦 Project Prometheus 的 Vik Bajaj,向 Caltech 教授 Anima Anandkumar 與她的合作者 Benedikt Jenik 提出了一份正式邀約:兩人合計 35% 股權、合計年薪 100 萬美元(三個月後調升至 200 萬)、以及包含 Bezos 本人在內的投資人所承諾的超過 20 億美元 A、B 輪融資。路透社審閱了這份邀約函。兩人拒絕了。
2026 年 8 月 25 日,他們公開了自己選擇打造的東西:Accelerated Understanding Inc.(品牌名「Au」),一家以企業客戶為目標的物理 AI 公司。其模型不以 Transformer 為基礎,而是建構在「神經算子」(neural operators)之上,並宣稱在測試中於單次推理內處理了超過 5 兆個連續物理數值——約為 Anthropic 與 Google 旗艦模型單次可處理量的 500 萬倍(儘管兩個數字衡量的其實是完全不同的東西)。
至於被他們拒絕的 Prometheus,則在 2026 年 6 月完成了 120 億美元的 B 輪融資,目標是以 AI 自動化複雜物理系統的製造。Anandkumar 與 Jenik 按自己的步調,繼續蓋自己的東西。
他們到底做了什麼
頭條數字需要拆解,因為它與語言模型的上下文視窗並不直接可比——而理解這一點,正是理解 Accelerated Understanding 想做什麼的關鍵。
語言模型的上下文計數的是離散 token:從連續輸入中切出、映射到固定詞彙表的字詞或子詞。Au 系統處理的則是在空間與時間中連續分布的物理場——三維體積中每一點在每個時間步的溫度、晶片散熱面上的壓力梯度、地層中的地質應力分布。每個數值都是連續量測,不是 token。該公司自己的資料其實描述了三個常被媒體混為一談的數字:預訓練模型達 1 兆參數、推理上下文超過 5 兆元素、以及一次高達 35 兆參數的縮放實驗。
四個主張定義了這套架構:
- 原生 4D 預測。 模型在三維空間中運作,並一次性預測完整的時間展開——四個維度同時處理。把空間壓平會損失細節;逐步自回歸預測則會讓誤差累積。
- 原生超高解析度。 模型具解析度不變性——訓練與推理時可任意切換細節層級,測試至 5 兆上下文,且不使用 patching 或降採樣等取巧手段。
- 多物理域塞進同一個模型。 流體力學、熱傳導、電磁波傳播與結構力學訓練進同一個網路。該公司報告觀察到「跨物理增益」——通用模型的表現勝過針對單一領域訓練的模型,呼應了規模化在語言上帶來的效益。
- 方向性回饋。 實驗只能告訴你「發生了什麼」,不會告訴你「為什麼」或「如何改進」。這些模型能提供改進方向,驅動「模擬 → 理解 → 改進」的發明與發現迴圈。
該公司已投入一年以上訓練前沿物理 AI 模型——數百次預訓練、最大達 1 兆參數的模型、高達 35T 的縮放實驗,平均每次訓練跑掉 2–6 PB 的資料。
為什麼 Transformer 講不了物理
Transformer 架構由 Google 研究者於 2017 年提出,處理的是離散 token 序列。它把世界當成序列預測問題,這對語言極為有效,對物理則不然。溫度、壓力、速度與材料應力是在空間中每一點、每一刻定義的連續變數。沒有任何 tokenization 方案能保存支配這些變數互動的連續空間關係——Transformer 必須先把連續場離散化到固定網格上,失去解析度不變性,解析度一變就得重新訓練。
神經算子走的是另一條路。它由 Anandkumar 的研究團隊於 2020 年首度提出並正式化於《Journal of Machine Learning Research》論文中,學習的是函數空間之間的映射,而非有限維向量之間的映射。輸入一個初始條件,算子便在任何解析度下回傳輸出函數,無需重新訓練——這個稱為「離散化不變性」的性質,古典數值求解器天生就有(換更細的網格即可),標準神經網路卻沒有。
Au 之前部署最廣的變體是傅立葉神經算子(FNO):以快速傅立葉變換近似核積分計算,用 O(N log N) 的成本捕捉全局物理結構。Anandkumar 的團隊用它打造了 2022 年的 FourCastNet——比傳統數值天氣預報快上數萬倍、準確度不相上下甚至更佳的 AI 全球天氣模型,目前已在多個一級氣象機構服役。Anandkumar 曾在 NVIDIA 擔任 AI 研究資深總監五年,說服 Jensen Huang 相信物理訓練的 AI 終將取代數值求解器;她向路透社回憶,Huang 的回應一如既往地直白:「我要它把他們的午餐全吃掉。」
Au 在 FMO 脈絡上往兩個方向延伸:原生 4D 運算與多域訓練。若跨域主張獲得驗證,將是超越 FourCastNet(僅大氣物理)與 PhysicsX(在特定工程領域成果強悍,但未主張跨域泛化)的質變。
一個模型,四個市場
Accelerated Understanding 將晶片設計最佳化、機器人、天氣預測與地質/能源分析列為首要商業領域。對每個市場的推銷話術相同:研發的瓶頸在實驗室與緩慢的數值模擬,而真實實驗只能告訴你發生了什麼、無法告訴你如何改進。一個能在數秒內、以任意解析度模擬物理並提供方向性回饋的模型,能把目前每次迭代動輒數天到數週的設計循環大幅壓縮。
競爭者也存在。與 Yann LeCun、Fei-Fei Li 相關的新創都在做比文字 AI 更懂物理空間的「世界模型」——但那些努力多半是影片預測架構,把 3D 空間壓平成 2D 影格、以自回歸方式逐步預測。Anandkumar 對這條哲學分野的定位是:「以語言為中心的智慧觀是以人類為中心。把物理放在中心,是一種以自然為中心的觀點。」
需要保持警覺的地方
這場發表也有真實的但書。該公司尚未發表技術論文、釋出可重現的評測程式碼、公布與既有模擬軟體的基準比較,也未宣布任何具名的量產客戶。發表當天出現的第三方技術分析指出,在宣稱的最大上下文下,單一推理樣本會產生約 22 TB 的輸出資料,意味著背後需要超越任何單一伺服器的分散式儲存與 GPU 基礎設施。Anandkumar 證實有硬體夥伴提供運算叢集,但拒絕点名;路透社詢問 NVIDIA 是否支持這家新創時,NVIDIA 並未回應。
這些都不代表這場發表是空包彈——Anandkumar 的研究血統(FourCastNet、神經算子的正式化本身)有同行審查文獻背書。但企業買家應把「5 兆」視為一家剛公開的新創自行陳述的規模主張,而非經獨立驗證的結果。
不過,這場豪賭的邏輯很清楚。如果智慧正變得越來越便宜、越來越充沛,瓶頸就會從「想出點子」轉移到「執行點子」——而物理世界的執行,終究要經過模擬。這兩位拒絕了 20 億美元安全網的創辦人,賭的是下一個基礎模型不是聊天機器人,而是直接被建模的宇宙。
Sources
- [1] https://www.reuters.com/business/ai-founders-who-walked-away-bezos-backed-prometheus-model-universe-2026-08-25/
- [2] https://acceleratedunderstanding.com/
- [3] https://www.techtimes.com/articles/325647/20260826/caltech-startup-unveils-physics-ai-that-skips-transformers-no-benchmark-proof-yet.htm
- [4] https://aiweekly.co/alerts/accelerated-understanding-launches-physics-ai-that-skips-transformers