阿里通義千問團隊在 Hugging Face 上釋出了 Qwen-Drive-1.0-4B,這是首個在預訓練階段就統一 3D 感知與視覺問答的自動駕駛視覺語言基礎模型,並進一步擴充套件至運動規劃。模型基於 Qwen3.5-4B 視覺語言模型,通過外部模組實現 3D 目標檢測、語義佔用預測、BEV 地圖分割以及未來軌跡生成,同時保持預訓練模型的架構不變。

該模型採用分階段訓練策略,將駕駛監督資料與通用視覺語言資料結合,使模型在獲得駕駛專用能力的同時,保留廣泛的視覺理解和指令跟隨能力。其核心創新在於,通過一個外部的 BEV 感知頭 作為顯式、可檢查的 3D 探針,與共享的視覺語言模型協同工作,而規劃專家模組則基於共享表示生成未來自車軌跡。

在運動規劃評測中,Qwen-Drive-1.0 在多個公開資料集上展現了競爭力。例如,在 WOD-E2E 開放迴圈評測中,其 SFT 版本的 RFS 分數達到 8.45(驗證集),優於 SpanVLA 的 8.20 和 SimWAM 的 7.95;在 NAVSIM 偽閉環評測中,其 RL 版本 PDMS 分數達 90.7,超過 AutoVLA 的 89.6 和 SpanVLA 的 90.3。在 AlpaSim 閉環評測中,其 RL 版本 at-fault 分數為 0.37,高於 SFT 版本的 0.27。

在視覺語言理解方面,Qwen-Drive-1.0-SFT 在多個基準上表現突出。在 LingoQA 駕駛問答上,其得分 77.8,遠超 InternVL3.5-8B 的 46.4 和 Cosmos-Reason1-7B 的 45.2;在 Ego3D 深度估計上,其 RMSE 降至 7.78,顯著優於其他模型;在 WaymoQA 安全相關問答上,得分 70.7,高於多數對比模型。此外,在通用知識、推理和空間理解基準上,該模型也保持了較強的效能,如 MMMU 得分 72.7,MMStar 得分 75.9。

值得注意的是,模型在強化學習後,僅在開放迴圈位移上略有犧牲,但在人類偏好對齊和閉環安全性上獲得全面提升。團隊還發布了兩個規劃專家版本:planner-sft 支援直接規劃和推理規劃,planner-rl 則進一步在 NAVSIM PDMS、WOD-E2E RFS 和位移項上進行了獎勵最佳化,在推理規劃模式下表現最佳。

該模型的釋出標誌著自動駕駛領域向統一基礎模型邁出重要一步,將 3D 感知、視覺問答和運動規劃整合到單一框架中,可能降低自動駕駛系統開發的複雜度。對於 AI 產業而言,這展示了通用視覺語言模型在垂直行業的應用潛力,或將對自動駕駛晶片、感測器及演算法供應商產生連鎖影響。