一個原本用於寫程式碼、處理文件和執行電腦任務的大模型,現在開始控制真車了。獨立研究專案 DrivingBench 公佈了一項實驗性測試:研究人員讓 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 以及 GPT-5.6 Sol 分別控制一輛真實的 2022 款豐田卡羅拉,在停車場內完成由錐桶劃定的固定路線。最終,GPT-6 Astra 成為四個模型中唯一完成全部賽道的模型。

測試車輛是一輛 2022 款豐田卡羅拉。研究人員在車上安裝了 comma four 裝置,通過 OBD-C 介面接入車輛 CAN 匯流排,底層車輛控制建立在開源輔助駕駛系統 openpilot 之上。車輛攝像頭拍攝的畫面以及速度、方向盤狀態等資訊即時傳輸至電腦,再通過 MCP 工具交給大模型。模型能夠使用三個核心工具:觀察車輛周圍環境、設定行駛方向及速度,以及立即停車。最終的轉向、加速和制動指令再經過 openpilot 傳遞給車輛。

換句話說,GPT-6 Astra 並沒有直接生成傳統自動駕駛系統中的方向盤扭矩或制動壓力,它更像坐在駕駛位上的大腦:根據攝像頭畫面判斷車輛在哪裡、道路往哪邊延伸、什麼時候需要轉彎,然後告訴底層控制系統向左還是向右、轉多少、以什麼速度行駛以及持續多長時間。測試路線設計成一個類似倒 U 形的停車場賽道,包含左轉、直線、緩彎、右轉等場景,終點是一塊由藍色錐桶圍出的停車區域。

GPT-6 Astra 的第一次駕駛並不順利。第一輪測試中,它行駛 67.3 米,完成大約 49% 的路線,用時 1 分 18 秒。車輛經過第一個彎道後逐漸偏向左側錐桶和綠化區域,安全員最終進行了人工干預。隨後發生的一幕可能比最終完成賽道更有意思:研究人員沒有重新開啟一個全新的對話,而是讓 Astra 在原有上下文中分析剛才失敗的原因。Astra 在覆盤中判斷,自己第一次駕駛時過早認為車輛已經完成對正,並且隨後將速度提高到 1.5 米/秒,導致車輛偏離之後缺乏足夠的修正空間。

到了第二次測試,它明顯改變了駕駛策略。DrivingBench 資料顯示,Astra 此後沒有再讓車輛速度超過 0.8 米/秒,同時明顯增加轉向幅度,在 24 次運動指令中有 20 次使用了 100% 的轉向請求。最終,它完成 134.7 米賽道,用時 5 分 22 秒,總共傳送 24 次車輛運動指令。這一輪測試消耗約 660 萬 token,按照當時模型價格計算成本約 7.74 美元。平均下來,這輛車的行駛速度只有大約 0.42 米/秒,相當於每小時 1.5 公里左右。談不上開得好,但至少開到了終點。

DrivingBench 研究人員認為,這次測試表現出了比較明顯的上下文學習特徵。模型並沒有重新訓練引數,而是依據第一次駕駛獲得的資訊,在第二次嘗試中調整了速度、轉向和操作節奏。

這次測試還有一個頗為有趣的插曲。研究人員發現,GPT-6 Astra 最初有時會拒絕控制真實車輛,並明確給出安全方面的理由。即便研究人員告訴模型場地為空曠停車場、車輛速度受到限制、車內也有安全員,它仍可能拒絕執行。後來研究人員將連線車輛的 MCP 工具名稱改成了 DrivingBench Sandbox,也就是駕駛測試沙盒,拒絕現象明顯減少。DrivingBench 團隊表示,他們目前也無法確定,這究竟來自模型對測試環境的判斷,還是單純受到 Sandbox 這一名稱的影響。

這個細節甚至比成功完賽更加值得研究。隨著大模型開始從電腦操作進一步進入機器人、汽車等真實物理裝置,模型不僅需要理解世界,還需要判斷哪些操作能夠執行,以及自己的行為究竟會造成什麼現實後果。

當然,134.7 米的成績不能和今天的城市 NOA 甚至 Robotaxi 直接比較。首先,這是一處封閉停車場,沒有機動車、行人、交通訊號燈以及複雜道路博弈。其次,DrivingBench 對車輛速度進行了嚴格限制,系統正常控制範圍最高為 3.5 米/秒,同時設定了更高一級的緊急速度保護。整個測試過程中,車內始終坐著一名安全員,腳放在制動踏板附近,隨時準備接管。攝像頭本身也存在明顯盲區,研究人員承認,前視攝像頭難以觀察距離車輛非常近的障礙物,也無法完整看到車輛兩側和後方。更重要的是,目前 DrivingBench 每個模型實際上只進行了一組連續上下文測試,樣本量遠遠不足以證明系統具備穩定駕駛能力。

從汽車工程角度看,真正的自動駕駛還要處理毫秒級感知和控制、感測器冗餘、極端場景、安全驗證以及數以億計的道路長尾問題。GPT-6 Astra 目前更像一個速度極慢、反應週期以秒計算,卻已經能夠理解部分物理環境的駕駛者。

OpenAI 在 9 月初發布 GPT-6 Astra 時,主要強調的是其在計算機操作、瀏覽器、軟體工程、科學研究等領域的能力,並沒有將汽車駕駛列為模型的核心應用。因此,這次 DrivingBench 實驗並不代表 GPT 會不會取代現有自動駕駛系統。更值得汽車行業關注的是,通用大模型正在逐漸獲得對真實物理世界的理解和操作能力。對於正在討論世界模型、Physical AI 和具身智慧的汽車行業而言,它提供了一個相當具體的樣本:未來決定汽車如何行動的模型,未必永遠只來自傳統自動駕駛技術體系。