阿里通义千问团队在 Hugging Face 上发布了 Qwen-Drive-1.0-4B,这是首个在预训练阶段就统一 3D 感知与视觉问答的自动驾驶视觉语言基础模型,并进一步扩展至运动规划。模型基于 Qwen3.5-4B 视觉语言模型,通过外部模块实现 3D 目标检测、语义占用预测、BEV 地图分割以及未来轨迹生成,同时保持预训练模型的架构不变。

该模型采用分阶段训练策略,将驾驶监督数据与通用视觉语言数据结合,使模型在获得驾驶专用能力的同时,保留广泛的视觉理解和指令跟随能力。其核心创新在于,通过一个外部的 BEV 感知头 作为显式、可检查的 3D 探针,与共享的视觉语言模型协同工作,而规划专家模块则基于共享表示生成未来自车轨迹。

在运动规划评测中,Qwen-Drive-1.0 在多个公开数据集上展现了竞争力。例如,在 WOD-E2E 开放循环评测中,其 SFT 版本的 RFS 分数达到 8.45(验证集),优于 SpanVLA 的 8.20 和 SimWAM 的 7.95;在 NAVSIM 伪闭环评测中,其 RL 版本 PDMS 分数达 90.7,超过 AutoVLA 的 89.6 和 SpanVLA 的 90.3。在 AlpaSim 闭环评测中,其 RL 版本 at-fault 分数为 0.37,高于 SFT 版本的 0.27。

在视觉语言理解方面,Qwen-Drive-1.0-SFT 在多个基准上表现突出。在 LingoQA 驾驶问答上,其得分 77.8,远超 InternVL3.5-8B 的 46.4 和 Cosmos-Reason1-7B 的 45.2;在 Ego3D 深度估计上,其 RMSE 降至 7.78,显著优于其他模型;在 WaymoQA 安全相关问答上,得分 70.7,高于多数对比模型。此外,在通用知识、推理和空间理解基准上,该模型也保持了较强的性能,如 MMMU 得分 72.7,MMStar 得分 75.9。

值得注意的是,模型在强化学习后,仅在开放循环位移上略有牺牲,但在人类偏好对齐和闭环安全性上获得全面提升。团队还发布了两个规划专家版本:planner-sft 支持直接规划和推理规划,planner-rl 则进一步在 NAVSIM PDMS、WOD-E2E RFS 和位移项上进行了奖励优化,在推理规划模式下表现最佳。

该模型的发布标志着自动驾驶领域向统一基础模型迈出重要一步,将 3D 感知、视觉问答和运动规划整合到单一框架中,可能降低自动驾驶系统开发的复杂度。对于 AI 产业而言,这展示了通用视觉语言模型在垂直行业的应用潜力,或将对自动驾驶芯片、传感器及算法供应商产生连锁影响。