阿里巴巴的研究部门近日发布了 Qwen-Drive 1.0,这是一个将环境空间感知、交通问答与路线规划整合于单一 AI 模型的系统。该模型基于 Qwen3.5-4B(2026 年 2 月发布)构建,通过增加两个模块——一个用于生成鸟瞰图以理解三维空间,另一个作为“规划专家”利用模型内部数据规划车辆未来数秒的运动——使模型既能作为驾驶系统运行,也能充当座舱助手,同时保留原有通用知识。研究团队在论文中强调,仅能描述图像的文本-图像模型并不会自动理解三维空间,空间感知能力必须经过专门训练才能获得。

现有驾驶模型通常采用通用文本-图像模型并在驾驶数据上微调,主要涉及交通情境的问答对。论文指出这种方法的两个弱点:仅靠交通问答训练,模型仍无法可靠检测距离、位置和空旷区域;而过度专业化于驾驶数据,则会导致“灾难性遗忘”,丢失原始训练中的广泛通用知识——这类知识在罕见、突发交通状况中恰恰最为关键。

Qwen-Drive 1.0 的训练流程分阶段进行:先训练感知模块,再结合感知与问答,随后进行路线规划,最后通过强化学习优化行为。视觉-语言组件整合了 24 个公开交通场景数据集,这些数据集结构各异且有时含错误,团队用 AI 模型标准化了问答并使其与原始数据对齐,还构建了自制的示例来解释为何车辆应做出特定驾驶决策(如哪个物体触发刹车)。

在 Qwen 自有的基准测试中,Qwen-Drive 1.0 在多数驾驶与感知类别上优于专用模型,且相比未修改的基座模型 Qwen3.5-4B,在交通场景问答上得分显著更高,尤其在解释因果(如为何刹车或转弯)方面差距最大。同时,模型在驾驶之外的测试上几乎无性能下降,部分空间任务得分甚至略有提升,表明通用能力得到保留。

在模拟器测试中,经过奖励重训的版本将车辆偏离道路率从 24% 降至 12%,且驾驶更谨慎、总行驶距离更短。然而,模型的解释并不总能准确指出情境的真实原因——例如,远处红灯与儿童闯入道路需要截然不同的反应时间,模型可能将两者混淆;计划的操作也并非总是与事先给出的推理一致。此外,部分结果基于作者自行设计或重建的测试流程,单项指标难以反映真实道路的复杂情况;当处理来自其他车辆、不同摄像头设置的画面时,模型检测能力大幅下降,因为适配这些配置的训练数据仍然缺失。

这一发布反映了汽车行业的一个趋势:信息娱乐系统与驾驶系统正从两个独立控制器向单一计算单元融合。论文作者认为,为追求纯粹驾驶性能而牺牲通用能力的模型在此背景下并不适用,因为座舱仍需单独的模型和额外算力来处理对话或开放式问题。Qwen-Drive 1.0 的架构旨在让一个模型同时承担驾驶与座舱功能,从而降低算力需求并保持知识连贯性。

对于 AI 产业观察者而言,该研究的意义在于:它验证了多模态大模型在具身智能(如自动驾驶)领域的可行性,同时揭示了当前技术的关键瓶颈——模型的空间理解与决策解释的一致性仍待提升。这也为后续研究指明了方向,即如何在保持通用能力的同时,增强模型对三维世界的结构化理解,并使其决策过程更可解释、更可靠。