一个原本用于写代码、处理文档和执行电脑任务的大模型,现在开始控制真车了。独立研究项目 DrivingBench 公布了一项实验性测试:研究人员让 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 以及 GPT-5.6 Sol 分别控制一辆真实的 2022 款丰田卡罗拉,在停车场内完成由锥桶划定的固定路线。最终,GPT-6 Astra 成为四个模型中唯一完成全部赛道的模型。

测试车辆是一辆 2022 款丰田卡罗拉。研究人员在车上安装了 comma four 设备,通过 OBD-C 接口接入车辆 CAN 总线,底层车辆控制建立在开源辅助驾驶系统 openpilot 之上。车辆摄像头拍摄的画面以及速度、方向盘状态等信息实时传输至电脑,再通过 MCP 工具交给大模型。模型能够使用三个核心工具:观察车辆周围环境、设定行驶方向及速度,以及立即停车。最终的转向、加速和制动指令再经过 openpilot 传递给车辆。

换句话说,GPT-6 Astra 并没有直接生成传统自动驾驶系统中的方向盘扭矩或制动压力,它更像坐在驾驶位上的大脑:根据摄像头画面判断车辆在哪里、道路往哪边延伸、什么时候需要转弯,然后告诉底层控制系统向左还是向右、转多少、以什么速度行驶以及持续多长时间。测试路线设计成一个类似倒 U 形的停车场赛道,包含左转、直线、缓弯、右转等场景,终点是一块由蓝色锥桶围出的停车区域。

GPT-6 Astra 的第一次驾驶并不顺利。第一轮测试中,它行驶 67.3 米,完成大约 49% 的路线,用时 1 分 18 秒。车辆经过第一个弯道后逐渐偏向左侧锥桶和绿化区域,安全员最终进行了人工干预。随后发生的一幕可能比最终完成赛道更有意思:研究人员没有重新开启一个全新的对话,而是让 Astra 在原有上下文中分析刚才失败的原因。Astra 在复盘中判断,自己第一次驾驶时过早认为车辆已经完成对正,并且随后将速度提高到 1.5 米/秒,导致车辆偏离之后缺乏足够的修正空间。

到了第二次测试,它明显改变了驾驶策略。DrivingBench 数据显示,Astra 此后没有再让车辆速度超过 0.8 米/秒,同时明显增加转向幅度,在 24 次运动指令中有 20 次使用了 100% 的转向请求。最终,它完成 134.7 米赛道,用时 5 分 22 秒,总共发送 24 次车辆运动指令。这一轮测试消耗约 660 万 token,按照当时模型价格计算成本约 7.74 美元。平均下来,这辆车的行驶速度只有大约 0.42 米/秒,相当于每小时 1.5 公里左右。谈不上开得好,但至少开到了终点。

DrivingBench 研究人员认为,这次测试表现出了比较明显的上下文学习特征。模型并没有重新训练参数,而是依据第一次驾驶获得的信息,在第二次尝试中调整了速度、转向和操作节奏。

这次测试还有一个颇为有趣的插曲。研究人员发现,GPT-6 Astra 最初有时会拒绝控制真实车辆,并明确给出安全方面的理由。即便研究人员告诉模型场地为空旷停车场、车辆速度受到限制、车内也有安全员,它仍可能拒绝执行。后来研究人员将连接车辆的 MCP 工具名称改成了 DrivingBench Sandbox,也就是驾驶测试沙盒,拒绝现象明显减少。DrivingBench 团队表示,他们目前也无法确定,这究竟来自模型对测试环境的判断,还是单纯受到 Sandbox 这一名称的影响。

这个细节甚至比成功完赛更加值得研究。随着大模型开始从电脑操作进一步进入机器人、汽车等真实物理设备,模型不仅需要理解世界,还需要判断哪些操作能够执行,以及自己的行为究竟会造成什么现实后果。

当然,134.7 米的成绩不能和今天的城市 NOA 甚至 Robotaxi 直接比较。首先,这是一处封闭停车场,没有机动车、行人、交通信号灯以及复杂道路博弈。其次,DrivingBench 对车辆速度进行了严格限制,系统正常控制范围最高为 3.5 米/秒,同时设置了更高一级的紧急速度保护。整个测试过程中,车内始终坐着一名安全员,脚放在制动踏板附近,随时准备接管。摄像头本身也存在明显盲区,研究人员承认,前视摄像头难以观察距离车辆非常近的障碍物,也无法完整看到车辆两侧和后方。更重要的是,目前 DrivingBench 每个模型实际上只进行了一组连续上下文测试,样本量远远不足以证明系统具备稳定驾驶能力。

从汽车工程角度看,真正的自动驾驶还要处理毫秒级感知和控制、传感器冗余、极端场景、安全验证以及数以亿计的道路长尾问题。GPT-6 Astra 目前更像一个速度极慢、反应周期以秒计算,却已经能够理解部分物理环境的驾驶者。

OpenAI 在 9 月初发布 GPT-6 Astra 时,主要强调的是其在计算机操作、浏览器、软件工程、科学研究等领域的能力,并没有将汽车驾驶列为模型的核心应用。因此,这次 DrivingBench 实验并不代表 GPT 会不会取代现有自动驾驶系统。更值得汽车行业关注的是,通用大模型正在逐渐获得对真实物理世界的理解和操作能力。对于正在讨论世界模型、Physical AI 和具身智能的汽车行业而言,它提供了一个相当具体的样本:未来决定汽车如何行动的模型,未必永远只来自传统自动驾驶技术体系。