會解釋自己的自駕車:MIT 與 Motional 的 CW-Net 打開自駕系統黑箱
今日發表於《Nature》的 CW-Net,能即時將自駕車決策系統的內部推理轉譯為人類可理解的概念,並在真實 robotaxi 測試中幫助安全駕駛提前預測車輛的錯誤行為。
自駕車由深度神經網路控制,而這些網路有時會以沒有人能輕易解釋的方式失靈——不論是乘客、安全駕駛,甚至是工程師都一樣。車輛可能毫無來由地緊急煞車,或擋住迎面而來的救護車。今天,MIT 與自駕技術公司 Motional 的研究團隊在《Nature》發表了一項打通黑箱的方法:Concept-Wrapper Network(CW-Net,概念包裹網路)。這是一個可解釋性模組,能在不影響駕駛表現的前提下,即時將自駕決策系統的內部推理轉譯成人類可以理解的概念。
為什麼黑箱是安全問題
機器學習決策系統(planner)是現代自駕車的「大腦」。它們接收攝影機與光達資料、建立環境摘要、決定車輛下一步行動,然後輸出軌跡。問題在於:這些決策系統是黑箱——決策過程纏繞在數百萬個參數之中,實際上無法直接檢視。
這種不透明有真實的後果。當 robotaxi 做出意外決策(業界稱之為「幽靈煞車」)時,坐在駕駛座上的人類可能只有幾秒鐘可以反應、避免碰撞,卻完全無法預測系統下一步會做什麼。可解釋性(interpretability)研究因此大量湧現,但正如論文作者所指出的,其中大多數只停留在模擬環境或玩具級的實驗設定,因為在真實車輛上部署解釋系統極為困難。這類技術究竟能不能在現實條件下真正幫到人類,一直是個懸而未決的問題——直到現在。
CW-Net 如何運作
CW-Net 是一個「概念分類器」(concept classifier):一種經過訓練、能預測輸入資料中存在哪些高階概念的 AI 演算法。關鍵在於它的位置。研究團隊把 CW-Net 模組插入車輛既有機器學習決策架構的「中段」,而不是事後外掛一個翻譯器。它將決策系統的內部推理轉譯成「接近停止車輛」或「靠近單車騎士」這類概念,然後強迫決策架構的最後一段在決定車輛行動時真正使用這些概念。
正是這個設計選擇,讓解釋具備「因果忠實性」(causally faithful)。因為概念確實驅動了決策,它們保證反映車輛行為背後的真正原因,而不是聽起來合理的事後合理化。第一作者 Eoin Kenny(前 MIT 博士後研究員,現任職於 J.P. Morgan Chase)表示:「特別是在自駕車這種高風險場景,解釋絕不能誤導。因為 CW-Net 在做決策時是因果忠實的,這為解釋提供了某種保證。」
為了讓概念偵測足夠穩健,團隊用一個包含 1.3 億筆自駕場景、每個場景標註多個概念的資料集來訓練 CW-Net。他們還讓模組去模仿原始決策系統的駕駛決策,因此加入 CW-Net 不會拖累車輛表現。概念隨後被轉成清楚的自然語言解釋,與車輛軌跡一起即時輸出。
那個「沒被偵測到」的單車騎士
最引人注目的成果來自封閉賽道的道路測試:CW-Net 部署在一輛真正的 Motional robotaxi 上,車上有安全駕駛。在一個極具啟發性的情境中,車輛每次接近單車騎士都會停下——安全駕駛自然假設車輛偵測到了騎士並禮讓。但 CW-Net 的解釋顯示真相並非如此:決策系統根本沒有正確設定來偵測單車騎士,而且最初選擇的軌跡會導致碰撞。車之所以停下,只是因為距離太近時緊急煞車程序被觸發了。
這正是那種會侵蝕安全邊際的錯誤認知。有了真正的解釋,安全駕駛知道在類似情境下要提前減速或更早接手手動駕駛——工程師也知道該修模型的哪一個環節。Kenny 說:「與其只是納悶車為什麼停下,即時數據給了你回饋,讓你能在部署期間測試系統。你也可以把這些數據交給工程師來改善系統。」
賽道上的發現,隨後在以拉斯維加斯街頭真實路況建構的大規模線上模擬研究中獲得印證。在那裡,CW-Net 的解釋顯著提升了非專業受試者預測自駕車行為的能力——尤其是在車輛偏離使用者預期的「意外情境」中。
可解釋性作為工程工具
資深作者們將這項貢獻定位為不只是介面上的功能。共同資深作者、MIT 航空與太空工程學系教授、CSAIL 互動機器人實驗室主持人 Julie Shah 表示:「這項工作顯示,解釋能支持人類的心智模型、幫助理解系統行為,而且可以用在工程與開發上來改進技術。除非我們用能夠信賴、能夠預測其行為的方式打造這些技術,否則它們的使用基礎是搖晃且不安全的。」
與她並列共同資深作者的是 Motional 的研究科學家 Momchil Tomov,團隊還包括 Motional 成員 Akshay Dharmavaram、Sang Uk Lee、Tung Phan-Minh、Shreyas Rajesh、Yunqing Hu,以及 Motional 總裁兼執行長 Laura Major。
影響範圍不僅止於 robotaxi。作者主張,這條經過部署驗證的路徑,同樣適用於其他安全關鍵的自主系統——無人機、手術機器人——以及包括端到端學習系統、視覺-語言-動作模型(vision-language-action models)在內的其他架構,而後者正是當前代理式 AI(agentic AI)浪潮的核心。
前方的路
團隊接下來計畫擴充 CW-Net 涵蓋的概念範圍,並探索不同的訓練與設計技術來進一步提升效能與可解釋性。更長遠的賭注是信任:隨著自駕車從試點走向日常交通工具,能夠準確、即時、帶因果保證地說出「車為什麼這樣做」,其重要性可能不亞於駕駛能力本身。
對一個長期要求大眾信任其無法解釋之系統的產業而言,一項登上《Nature》、經過實路驗證的忠實機器解釋方法,是個有意義的里程碑。Kenny 說:「我們的研究顯示,可解釋性在這些高風險環境中有多麼關鍵,未來人們在打造 AI 時——不論是自駕車還是其他安全關鍵環境——都應該把它放在心上。」
背景脈絡
值得留意的是,這項研究發表的時機,正值自駕產業因多起高感知事故而面臨監管壓力、各國主管機關開始要求可審計的決策日誌之際。CW-Net 展示的「因果忠實」路線,與事後逼近式的解釋方法(如 LIME、SHAP)形成對比:它不改變黑箱、也不事後猜測,而是從架構內部強制讓概念與決策互相約束。若這條路線被驗證可規模化,「車輛為什麼這樣開」將從哲學問題變成工程問題——而這正是監管、保險與公眾信任共同需要的基礎設施。
Sources
- [1] https://news.mit.edu/2026/system-helps-humans-predict-when-self-driving-cars-will-make-mistakes-0902
- [2] https://www.nature.com/articles/s41586-026-10950-5
- [3] https://arxiv.org/html/2411.18714v3
- [4] https://www.artificialintelligence-news.com/news/motional-and-mit-ai-explains-self-driving-car-decisions/