阿里巴巴的研究部門近日釋出了 Qwen-Drive 1.0,這是一個將環境空間感知、交通問答與路線規劃整合於單一 AI 模型的系統。該模型基於 Qwen3.5-4B(2026 年 2 月釋出)構建,通過增加兩個模組——一個用於生成鳥瞰圖以理解三維空間,另一個作為“規劃專家”利用模型內部資料規劃車輛未來數秒的運動——使模型既能作為駕駛系統執行,也能充當座艙助手,同時保留原有通用知識。研究團隊在論文中強調,僅能描述影像的文本-影像模型並不會自動理解三維空間,空間感知能力必須經過專門訓練才能獲得。

現有駕駛模型通常採用通用文本-影像模型並在駕駛資料上微調,主要涉及交通情境的問答對。論文指出這種方法的兩個弱點:僅靠交通問答訓練,模型仍無法可靠檢測距離、位置和空曠區域;而過度專業化於駕駛資料,則會導致“災難性遺忘”,丟失原始訓練中的廣泛通用知識——這類知識在罕見、突發交通狀況中恰恰最為關鍵。

Qwen-Drive 1.0 的訓練流程分階段進行:先訓練感知模組,再結合感知與問答,隨後進行路線規劃,最後通過強化學習最佳化行為。視覺-語言元件整合了 24 個公開交通場景資料集,這些資料集結構各異且有時含錯誤,團隊用 AI 模型標準化了問答並使其與原始資料對齊,還構建了自制的示例來解釋為何車輛應做出特定駕駛決策(如哪個物體觸發剎車)。

在 Qwen 自有的基準測試中,Qwen-Drive 1.0 在多數駕駛與感知類別上優於專用模型,且相比未修改的基座模型 Qwen3.5-4B,在交通場景問答上得分顯著更高,尤其在解釋因果(如為何剎車或轉彎)方面差距最大。同時,模型在駕駛之外的測試上幾乎無效能下降,部分空間任務得分甚至略有提升,表明通用能力得到保留。

在模擬器測試中,經過獎勵重訓的版本將車輛偏離道路率從 24% 降至 12%,且駕駛更謹慎、總行駛距離更短。然而,模型的解釋並不總能準確指出情境的真實原因——例如,遠處紅燈與兒童闖入道路需要截然不同的反應時間,模型可能將兩者混淆;計劃的操作也並非總是與事先給出的推理一致。此外,部分結果基於作者自行設計或重建的測試流程,單項指標難以反映真實道路的複雜情況;當處理來自其他車輛、不同攝像頭設定的畫面時,模型檢測能力大幅下降,因為適配這些配置的訓練資料仍然缺失。

這一發布反映了汽車行業的一個趨勢:資訊娛樂系統與駕駛系統正從兩個獨立控制器向單一計算單元融合。論文作者認為,為追求純粹駕駛效能而犧牲通用能力的模型在此背景下並不適用,因為座艙仍需單獨的模型和額外算力來處理對話或開放式問題。Qwen-Drive 1.0 的架構旨在讓一個模型同時承擔駕駛與座艙功能,從而降低算力需求並保持知識連貫性。

對於 AI 產業觀察者而言,該研究的意義在於:它驗證了多模態大模型在具身智慧(如自動駕駛)領域的可行性,同時揭示了當前技術的關鍵瓶頸——模型的空間理解與決策解釋的一致性仍待提升。這也為後續研究指明瞭方向,即如何在保持通用能力的同時,增強模型對三維世界的結構化理解,並使其決策過程更可解釋、更可靠。