← All posts / Models

一顆大腦開整台車:阿里巴巴開源 Qwen-Drive-1.0,4B 視覺語言模型同時會看、會講、會開車

阿里巴巴 Qwen 團隊開源 Qwen-Drive-1.0-4B:一套視覺語言基礎模型,整合 3D 感知、駕駛問答與軌跡規劃於一身,採 Apache 2.0 授權釋出,且完全不改動基礎的 Qwen3.5-4B 架構。

一顆大腦開整台車:阿里巴巴開源 Qwen-Drive-1.0,4B 視覺語言模型同時會看、會講、會開車

自駕系統長年以來都是「分裂腦」架構:感知網路用張力(tensor)看世界、規劃器輸出沒人看得懂的軌跡,而車艙裡的聊天機器人能聊這趟旅程,卻完全不知道車子下一步要做什麼。9 月 7 日,阿里巴巴 Qwen 團隊與華中科技大學合作,以 Apache 2.0 授權釋出 Qwen-Drive-1.0-4B,嘗試把整個技術棧收斂成單一視覺語言基礎模型——同時做 3D 感知、回答駕駛場景的自由提問、並生成實際的行車軌跡,而且完全不更動預訓練 VLM 的架構。

這次到底釋出了什麼

Qwen-Drive-1.0 以原生多模態的 Qwen3.5-4B 為共用骨幹,外掛兩個模組:

  • BEV 感知頭(0.5 GB):同時執行 3D 物件偵測、語義佔用預測與鳥瞰圖分割。團隊刻意讓這個頭保持簡單,讓它成為 VLM 表徵中 3D 資訊的「明確、可檢視探針」,而不是衝榜用的專家模組。
  • 規劃專家(Planning Expert):以共用 VLM 表徵為條件,透過流匹配(flow matching)生成未來自車軌跡。釋出兩個版本:planner-sft(2.1 GB,模仿學習訓練,支援直接與推理兩種規劃模式)與 planner-rl(2.1 GB,進一步在 NAVSIM PDMS、Waymo E2E RFS 與位移項上做獎勵優化)。

整個儲存庫就是一個目錄:9.1 GB 的 VLM 放在根目錄,各任務頭放在旁邊的子資料夾。只載入根目錄,它就是駕駛場景聊天機器人;接上規劃器後呼叫 run(InferenceMode.REASONING_PLANNING, ...),會回傳 (6, 50, 3) 形狀的軌跡採樣——六條候選路徑、5 秒、10 Hz,每點含 x、y 與航向角。示範腳本內建四個規劃場景與六個感知畫格,無需額外資料即可端對端跑通。技術報告發表於 arXiv(2609.00111,8 月 31 日由周鑫等十六位作者提交,含白翔教授團隊),程式碼在 GitHub 上的 QwenLM/Qwen-Drive-1.0。

數據表現

核心主張——駕駛能力可以加上去、通用能力不必被砍掉——在公開的評測表中站得住腳。

軌跡規劃。 在開放迴路 WOD-E2E 上,RL 規劃器拿到 8.45(val)/ 7.91(test)的 RFS,勝過 MindVLA-U1 的 8.20/7.87;5 秒 ADE 更降到 1.27,幾乎砍半次佳的 2.28。在偽封閉迴路的 NAVSIM 上拿到 90.7 PDMS(SpanVLA 與 SimWAM 為 90.3),best-of-6 採樣更達 91.4。唯一沒贏的是 AlpaSim 封閉迴路:Alpamayo-1.5 的 0.45 at-fault 分數高於 Qwen-Drive 的 0.37——不過 RL 版相對自家 SFT 版的 0.27 已提升 37%。團隊的說法很誠實:強化學習之後,模型「只犧牲了些微的開放迴路位移,就換來人類偏好對齊與封閉迴路安全的全面提升」。

駕駛問答。 差距更懸殊。LingoQA 拿 77.8,次佳 MiMo-Embodied-7B 為 72.0;WaymoQA 安全題 70.7 對 66.5;在 DRAMA 因果推理基準 CoC 上它拿到 41.3,而所有對手——包括 NVIDIA Cosmos 系列的駕駛 VLM——都在 4.0 以下。Ego3D 深度 RMSE 降到 7.78,次佳為 9.85。

通用能力。 這通常是崩壞的地方。MMStar 不降反升至 75.9(基礎版 75.3),MMMU 只從 73.4 微降到 72.7,MMBench 維持 85.5 對 87.1。階段式訓練配方——跨資料集統一軌跡標註、改寫回應、一致性過濾、並全程摻入通用視覺語言資料——顯然擋住了災難性遺忘,而這是團隊明列的設計目標,不是運氣。

但有個但書,而且很重要

The Decoder 的報導補上一個值得認真看待的警訊:論文自己的分析顯示,模型對某個操作的「解釋」不見得與它實際執行的動作一致。這項發現是一體兩面。它證實了研究者的核心論點——文字-圖像模型不會自動理解三維空間,空間感必須刻意訓練(所以需要 BEV 探針)。但它也意味著,乘客聽到的自然語言理由,還不是實際指揮方向盤的物理學的真實陳述。對一個越來越重視「可解釋自駕」的產業——監管機關 included——這個差距正是「聊天功能」與「稽核紀錄」之間的那條線。

為什麼這次釋出重要

第一,經濟因素:4B 參數、含任務頭總計不到 12 GB 的模型,可以部署在車規硬體上,不必依赖 H100 叢集。第二,來源純正:純用公開資料集(nuScenes、Waymo、NAVSIM 等)加上統一的軌跡格式訓練,任何實驗室都能重現、微調或擴展——這是真正的基礎模型打法,不是展示品。第三,戰略訊號:阿里巴巴正把 Qwen 定位成具身智慧(embodied AI)的預設開源權重棧,就像它先前在文字領域做的那樣;而中國團隊如今公開挑戰「車艙與傳動系統統一」這個西方大廠只在閉門 demo 裡碰過的題目。

團隊把標題取為「初始的一步」(an initial step)很說明問題。Qwen-Drive-1.0 沒有在每個基準上打贏每個專家,它的解釋也仍偶爾與行動脫節。但作為一個單一、開放、可檢視、統一了看、講、開三件事的成品——它是迄今駕駛模型下一步走向最清晰的藍圖。