DrivingBench 显示 GPT-6 Astra 可以驾驶一辆真实的 Toyota Corolla 完成绕桩测试
GPT‑6 Astra 驾驶真实汽车——该基准测试证明了什么,又没证明什么
要点: GPT‑6 Astra 被连接到 Toyota Corolla 的转向、油门和刹车系统,并成功完成了预设的绕桩基准测试,证明了前沿规模的 LLM 可以在受控环境中发出底层的车辆控制指令。这一结果是一个引人注目的概念验证,但讨论也强调,延迟、现实世界的动态变化以及安全性使得该方法在当前的自动驾驶生产中并不实用。
DrivingBench 的测量内容
- 设置: 一辆 Toyota Corolla 经过改装,使得 LLM 可以通过 CAN‑bus 接口调用
set_motion(转向、油门、刹车)和stop_now。 - 任务: 在固定的锥桶赛道中行驶,同时保持在中心线周围 4 米的走廊内。
- 指标:
- 尝试进度:在发生碰撞或未完成(DNF)之前穿过的中心线比例。
- 距离:从第一个被接受的运动指令到最后一个指令的 GPS 集成距离。
- 完成时间:从第一个被接受的指令到尝试结束所经过的时间。
- 指令:
set_motion和stop_now调用的次数。 - Token · 成本:使用的 LLM Token 总数以及按标价计算的相应 API 成本。
- 排行榜: 每个模型在单次连续聊天会话中最多可以进行三次尝试;可以通过视频和轨迹回放单独检查运行情况。
"探索赛道 – 查看轨迹回放" – DrivingBench UI (https://drivingbench.com/)
Astra 的表现
- Astra 在所列模型中实现了最高的尝试进度,在未离开 4 米走廊的情况下完成了赛道。
- 该运行需要 X 次
set_motion调用(排行榜上显示了确切计数),并消耗了 Y 个 Token,按当前 API 费率计算成本约为 $Z。 - 视频证据显示,汽车在低速行驶时平稳地跟随锥桶线,并在碰撞前停下。
注意:由于抓取的页面多次重复指标描述,因此源文件中没有确切的数值。
社区分析:延迟是致命伤
云端延迟扼杀了现实世界的可行性
"即使在云服务中增加一个光速 RTT 也是非常糟糕的……到那时,汽车周围的世界已经发生了变化。" – jyoung8607,前 openpilot 贡献者
Open‑pilot 更新以 20 Hz(每 50 毫秒)的频率针对曲率和加速度进行调整。基于云的 LLM 引入了数百毫秒量级的往返时间,远远超过了在动态交通中安全运行所需的控制循环预算。
硬件在环(Hardware‑in‑the‑loop)仍然是强制性的
"特斯拉和其他所有自动驾驶制造商都需要车内计算硬件是有原因的。" – jyoung8607
即使 LLM 能够生成完美的转向指令,将原始摄像头帧传输到远程模型、等待推理并发送回驱动指令的延迟,也会使该系统在静态、低速赛道之外无法使用。
一些人认为延迟是唯一的障碍
"目前这主要是延迟问题。模型太大,无法在本地运行,但考虑到像 Qwen 这样的开源权重模型已经存在,一个开源权重、低延迟的 Astra 等效模型应该不会太远。" – valine
社区一致认为,核心技术障碍是设备端的实时推理,而不是模型能力。
讨论中的其他观察
- 视觉能力: 评论者注意到 Astra 在视觉密集型基准测试(如 ARC‑3, SpatialBench)中的出色表现,并推测其多模态训练有助于驾驶成功。
- 工具使用框架: 一些人将该基准测试视为 LLM 作为通用工具使用者的演示,而不是专门的感知流水线。
- 安全与责任: 一些用户警告不要在公共道路上部署此类系统,理由是不可预测的行为和法律风险。
- 基准测试的新颖性: 社区认为该基准测试很有趣,但质疑其与实际自动驾驶技术栈的相关性。
为什么该基准测试对 AI 研究很重要
- 多模态集成的证明: Astra 可以摄取视觉输入、进行语言推理并发出底层控制信号,展示了迈向统一感知‑行动模型的一步。
- 工具使用流水线: 该实验将汽车视为 LLM 可以调用的工具,这与 LLM 编排外部 API 的新兴研究相一致。
- 指标透明度: 通过发布尝试进度、Token 使用量和成本,DrivingBench 为比较未来模型提供了一个可重复的框架。
局限性和悬而未决的问题
- 可扩展性: 该基准测试在简单的锥桶赛道上以低速运行;它没有测试与交通、行人或复杂道路几何形状的交互。
- 延迟测量: 公开数据不包含端到端延迟数据;没有这些数据,就不可能评估实时可行性。
- 安全保证: 没有描述正式的验证或故障安全机制;系统依赖于人工监督。
- 成本: 按标价 Token 费率计算,单次运行成本为几美元,这对于大规模测试来说可能是昂贵的。
展望
DrivingBench 表明,像 GPT‑6 Astra 这样的前沿 LLM 在技术上可以在受限环境中控制真实车辆,这标志着多模态 AI 的一个里程碑。然而,Hacker News 上的共识很明确:延迟和安全性仍然是在现实世界自动驾驶中部署基于云的 LLM 的不可逾越的障碍。未来的进展可能取决于将相当的模型能力引入边缘硬件,或者设计结合快速感知栈与更高级别 LLM 推理的混合系统。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- Dispatch