← All posts / Research

Waymo 的十堂 AI 課:2 億英里全無人駕駛里程換來的工程真相——「自駕沒有捷徑」

Waymo 軟體副總 Srikanth Thirumalai 將 15 年、超過 2 億英里的全無人駕駛里程,濃縮成十條工程真理——多感測器融合不可妥協、純端到端達不到安全標準、再大的模型也取代不了真實無人駕駛經驗。

Waymo 的十堂 AI 課:2 億英里全無人駕駛里程換來的工程真相——「自駕沒有捷徑」

在一個慣於用發表影片與里程碑推文來溝通的產業裡,Waymo 做了一件罕見的事:把自己的工程手冊攤開來給所有人看。2026 年 8 月 26 日,Waymo 車載軟體副總裁 Srikanth Thirumalai 發表了《10 AI Lessons from Driving 200+ Million Fully Autonomous Miles》(十堂來自 2 億英里全無人駕駛的 AI 課),把這家 Alphabet 子公司十五年以上的累積,以及地球上最大規模的無人駕駛實戰資產,拆解成一份坦白的經驗清單。

這個時間點並非巧合。在搭配發布的 Axios 獨家專訪中,Thirumalai 把核心論點講得更白:自駕沒有 AI 捷徑。 當推理模型與端到端神經網路架構承諾能壓縮開發時程,Waymo 正面反擊「更好的模型就能取代一切」的論述——感測器、高精地圖、模擬環境與安全治理,這些花了十七年堆出來的樓層,沒有一層可以省略。

為什麼此刻重要

自駕產業已經分裂成兩個陣營。Waymo 代表「傳統架構 + 基礎模型」路線:專用硬體、光達雷達與攝影機並用、高精地圖,外加層層獨立驗證。另一批新挑戰者——最知名的是 Tesla,還有 Wayve、Waabi 等新創——押注「AV 2.0」:以攝影機為主、端到端神經網路直接把原始感測資料轉成駕駛指令,並主張模型規模與智慧程度的提升,將以更快、更便宜的方式補上安全差距。

這場論戰的賭注極大。如果 Waymo 是對的,它 2 億英里的領先就是一道資金砸不穿的護城河。如果端到端陣營是對的,Waymo 的複雜架構反而成為包袱,會被更敏捷的對手繞過。誠如 Axios 所言,Thirumalai 這篇文章是刻意為之的論述——目的在於「反擊『AI 能為安全自駕提供捷徑』的敘事,而自駕產業的公眾信任正懸於一線」。

十堂課,濃縮版

一、多模態感測器不可或缺。 自駕史上最長的辯論——只靠攝影機能否解決全自駕?——得到一個直白的答案:「大規模的安全全無人營運,需要更多。」Waymo 給每個感測器一個角色:光達提供毫米級精度的 3D 線框、攝影機負責讀標誌與紅綠燈的語意層、雷達追蹤速度且能穿透大雨、濃霧與沙塵。Thirumalai 對 Axios 說:「AI 只能理解它看得見的東西,如果你就是看不見,AI 也無能為力。」

二、高精地圖是強大的先驗資訊。 第二場大辯論——要不要用地圖——同樣由 Waymo 這邊得分。地圖是「另一個輸入,像感測器一樣,但扮演心理記憶的角色」,讓車上算力專注於動態與新事物。宣稱地圖不必要的對手,等於默默放棄了一層冗餘保障。

三、更少、更大的模型更好。 Waymo 早期的系統跑數十個專用模型——一個認行人、一個看紅綠燈——Thirumalai 稱之為「模組化義大利麵」,規模一大就無法維護。公司已整併為更少、更高容量的基礎模型,刻意搭上驅動大型語言模型突破的同一班 scaling laws 列車,並用教師—學生蒸餾塞進車載算力預算。

四、黑盒子無法建立信任。 這是對端到端架構最尖銳的一擊。純 E2E 系統把像素直接映射成方向盤指令,失敗模式難以解釋。Waymo 的答案是獨立的車載 AI 驗證層,用物理硬約束與交通法規檢查每一條軌跡提案——是「不可妥協的最後防線」,對 L4 規模化「無談判空間」。

五、閉環模擬才能挖出邊角案例。 重放錄影(開環模擬)「像走進影片重播」,周圍車流對你的動作毫無反應。只有閉環模擬——周圍交通會回應自駕車的決策——才能創造找出百萬分之一事件所需的回饋迴路,在它們上街之前。

六、每個好駕駛都需要一個好評審。 Waymo 打造了一個 AI Critic(評審),持續為駕駛行為打分數——安全、法遵、平順度、煞車舒適度——每週掃過數百萬實路英里與數百億模擬英里。少了它,Driver 就會陷入「自己改自己考卷」的風險。

七、視覺語言模型強化場景推理。 面對訓練資料外的情境——例如車禍現場員警用手勢指揮交通——Waymo 用 Gemini 訓練的 VLM 作為「推理夥伴」,提供高層語意提示。但 VLM 太慢、空間精度不足,無法做即時控制,因此系統採「快思慢想」架構:底層用快速感測融合做即時控制,上層用 VLM 做深思熟慮的推理。

八、AI 的成效,取決於評估它的治理。 「開發完就上路」漏看了全局。Waymo 的整備框架把駕駛、模擬與評估包進量化的安全治理與專家人類判斷,才做成任何部署決策。

九、資料飛輪驅動持續進步。 每週駕駛里程、乘客回饋與 Critic 持續浮出候選問題;自動標註器在 EB 級資料中分類;模型重訓後再經模擬與安全框架驗證。把這個循環工程化,才讓 L4 系統能系統性地吃下駕駛長尾。

十、沒有任何東西能取代全無人駕駛經驗。 最後一課也最尖銳:「把駕駛輔助系統(L2)持續改良成全自駕,是一座假山頂。」系統只有在「獨自承擔駕駛任務」時才會真正成熟——這是對「升級駕駛輔助即可畢業」策略的直接否定。

字裡行間的訊息

Axios 的解讀毫不客氣:這同時也是肌肉展示。Waymo 希望監管機構與產業採納的安全標準,「正好對應它最大的競爭優勢:多年測試與實路數據堆出來的巨大領先」。透過論證純端到端系統尚無法達到它的安全標準,Waymo 等於墊高了 Tesla、Wayve 與 Waabi 必須跨越的門檻——而且最好是在監管者眼中、用證據跨越。

引言在「模型至上主義」上著力最深。「即使是最強、有數兆參數的 AI 模型仍然會幻覺,」Thirumalai 說。「我們沒有辦法說『按個重整鍵重來』……物理世界的 AI 沒有點擊重開機、重新載入或重新整理。你必須承擔後果。」

現實背景讓論點更具體。Tesla 正準備 9 月 3 日的 Cybercab 發表會,押的正是純視覺、端到端路線——但其機器計程車里程至今僅以數十萬英里計。內華達州最近核定 Tesla、Waymo 與 Uber 陣營合計最多 8,000 輛機器計程車,意味著兩種哲學很快會在拉斯維加斯街頭爭搶同一批乘客。Waymo 的隱含賭注是:當純攝影機系統遇見那個光達一笑置之、百萬分之一的濃霧加逆光場景時,2 億英里的論證會自己給出答案。

必須說的反面

有兩個反論值得攤開。第一,Waymo 把安全性定義為「累積經驗的函數」有明顯的商業利益——而經驗正是它存量壓倒性過剩的唯一要素。第二,誠如 Axios 自己所言,這套論述「並未終結辯論」。AI 進展一再讓宣稱「下一個範式不夠用」的公司難堪;如果配備健全執行期驗證的端到端系統比預期更快成熟,Waymo 的多層堆疊就會從護城河變成成本負擔。

但這正是這篇文章值得細讀的原因。它是迄今對美國唯一達到商業規模的機器計程車網路背後工程哲學最完整的表述——十條可檢驗、有數據支撐、且對產業與監管者如何定義「夠安全」影響深遠的主張。從拉斯維加斯到華盛頓特區,未來幾年的機器計程車擴張,就是一場關於 Thirumalai 這十堂課究竟是普世真理、還是現任領先者防禦姿態的活體實驗。

至少此刻,Waymo 對 AI 加速主義陣營的訊息很簡單:物理世界的 AI,沒有重整鍵——也沒有捷徑。