DrivingBench 顯示 GPT-6 Astra 能夠駕駛真實的 Toyota Corolla 完成錐筒路線

GPT‑6 Astra 駕駛真實車輛——該基準測試證明了什麼,又沒證明什麼

重點摘要: GPT‑6 Astra 被連接到 Toyota Corolla 的轉向、油門和煞車系統,並成功完成了預設的錐筒路線基準測試,證明了前沿規模的 LLM 可以在受控環境中發出低階車輛指令。這一結果是一個引人注目的概念驗證,但討論也強調,延遲、現實世界的動態變化以及安全性使得這種方法在目前的自動駕駛生產環境中並不切實際。


DrivingBench 的測量項目

  • 設置: 一輛 Toyota Corolla 經過儀器改裝,使 LLM 可以透過 CAN‑bus 介面呼叫 set_motion(轉向、油門、煞車)和 stop_now 指令。
  • 任務: 在固定的錐筒路線中導航,同時保持在中心線周圍 4 公尺的走廊內。
  • 指標:
    • 嘗試進度:在發生碰撞或未完成(DNF)之前,穿越中心線的比例。
    • 距離:從第一個被接受的運動指令到最後一個指令的 GPS 整合距離。
    • 完成時間:從第一個被接受的指令到嘗試結束所經過的時間。
    • 指令:set_motion 和 stop_now 呼叫的次數。
    • Token · 成本:使用的 LLM Token 總數以及按定價計算的 API 成本。
  • 排行榜: 每個模型在單次連續聊天對話中最多可進行三次嘗試;運行過程可以透過影片和軌跡回放進行個別檢查。

"探索賽道 – 查看軌跡回放" – DrivingBench UI (https://drivingbench.com/)

Astra 的表現

  • Astra 在列出的模型中實現了最高的嘗試進度,在沒有離開 4 公尺走廊的情況下完成了路線。
  • 該次運行需要 X 次 set_motion 呼叫(排行榜上顯示確切次數),並消耗了 Y 個 Token,按目前的 API 費率計算,成本約為 $Z。
  • 影片證據顯示,車輛在低速下平穩地跟隨錐筒線,並在碰撞前停下。

注意:由於抓取的頁面多次重複指標描述,因此來源中無法取得確切的數值。

社群分析:延遲是關鍵阻礙

雲端延遲扼殺了現實世界的可行性

"即使在雲端服務中增加單次光速 RTT 也是非常糟糕的……到那時,車輛周圍的世界已經發生了變化。" – jyoung8607,前 openpilot 貢獻者

Open‑pilot 更新以 20 Hz(每 50 毫秒)的頻率針對曲率和加速度進行調整。基於雲端的 LLM 引入了數百毫秒等級的往返時間,遠遠超過了在動態交通中安全操作所需的控制迴路預算。

硬體迴路(Hardware‑in‑the‑loop)仍然是必要的

"Tesla 和其他所有自動駕駛製造商需要車內運算硬體是有原因的。" – jyoung8607

即使 LLM 能夠產生完美的轉向指令,將原始攝影機畫面傳輸到遠端模型、等待推論並傳回驅動指令的延遲,也會使該系統在靜態、低速路線之外無法使用。

根據部分觀點,延遲是唯一剩下的障礙

"目前這主要是延遲問題。模型太大而無法在本地運行,但考慮到像 Qwen 這樣的開放權重模型已經存在,與 Astra 相當的開放權重、低延遲替代方案應該不會太遠。" – valine

社群一致認為,核心技術障礙是裝置上的即時推論,而非模型能力。

討論中的其他觀察

  • 視覺能力: 評論者注意到 Astra 在視覺密集型基準測試(例如 ARC‑3、SpatialBench)中的強勁表現,並推測其多模態訓練有助於駕駛成功。
  • 工具使用框架: 一些人將此基準測試視為 LLM 作為通用工具使用者的演示,而非專業的感知管線。
  • 安全與責任: 幾位使用者警告不要在公共道路上部署此類系統,理由是行為不可預測且存在法律風險。
  • 基準測試的新穎性: 社群認為該基準測試很有趣,但質疑其與實際自動駕駛堆疊的相關性。

為什麼該基準測試對 AI 研究很重要

  1. 多模態整合的證明: Astra 可以接收視覺輸入、進行語言推理並發出低階控制訊號,顯示了邁向統一感知-行動模型的一步。
  2. 工具使用管線: 該實驗將車輛視為 LLM 可以呼叫的工具,這與 LLM 編排外部 API 的新興研究相一致。
  3. 指標透明度: 透過發布嘗試進度、Token 使用量和成本,DrivingBench 為比較未來模型提供了一個可重現的框架。

限制與待解問題

  • 可擴展性: 該基準測試是在簡單的錐筒路線上以低速運行;它沒有測試與交通、行人或複雜道路幾何結構的互動。
  • 延遲測量: 公開數據不包含端到端延遲數據;沒有這些數據,就不可能評估即時可行性。
  • 安全保證: 未描述任何形式驗證或故障安全機制;系統依賴於人類監督。
  • 成本: 按定價的 Token 費率計算,單次運行成本為數美元,這對於大規模測試來說可能過於昂貴。

前景

DrivingBench 證明了像 GPT‑6 Astra 這樣的前沿 LLM 可以在受限環境中技術上控制真實車輛,這標誌著多模態 AI 的一個里程碑。然而,Hacker News 上的共識很明確:延遲和安全性仍然是在現實世界自動駕駛中部署基於雲端 LLM 的不可逾越的障礙。未來的進展可能取決於將相當的模型能力引入邊緣硬體,或設計結合快速感知堆疊與更高階 LLM 推理的混合系統。

Sources

相關