DrivingBenchは、GPT-6 Astraが実際のトヨタ・カローラをコーンコースで操縦できることを実証

GPT-6 Astraが実車を運転 – このベンチマークが証明するものとしないもの

要点: GPT-6 Astraをトヨタ・カローラのステアリング、アクセル、ブレーキに接続し、あらかじめ設定されたコーンコースのベンチマークを完了させました。これにより、フロンティアスケールのLLMが制御された環境下で低レベルの車両コマンドを発行できることが証明されました。この結果は驚くべき概念実証ですが、議論ではレイテンシ、現実世界のダイナミクス、安全性の観点から、このアプローチを現在の自動運転の実用化に適用することは非現実的であると指摘されています。


DrivingBenchの測定項目

  • セットアップ: トヨタ・カローラを計装し、LLMがCANバスインターフェースを介して set_motion(ステアリング、スロットル、ブレーキ)および stop_now を呼び出せるようにしています。
  • タスク: 中心線から4m以内のコリドーを維持しながら、固定されたコーンコースを走行する。
  • 指標:
    • 試行進捗: 衝突またはDNF(途中棄権)までに走行した中心線の割合。
  • 距離: 最初の有効なモーションコマンドから最後のコマンドまでのGPS統合距離。
  • 終了時間: 最初の有効なコマンドから試行終了までの経過時間。
  • コマンド: set_motion および stop_now の呼び出し回数。
  • トークン・コスト: 使用されたLLMトークンの合計と、リスト価格に基づくAPIコスト。
  • リーダーボード: 各モデルは1回の連続チャットセッションで最大3回まで試行可能。実行内容はビデオと軌跡のリプレイで個別に確認できます。

"コースを探索する – 軌跡リプレイを見る" – DrivingBench UI (https://drivingbench.com/)

Astraのパフォーマンス

  • Astraはリストされたモデルの中で最高の試行進捗を達成し、4mのコリドーを外れることなくコースを完走しました。
  • この走行には X 回の set_motion 呼び出し(正確な回数はリーダーボードに表示)が必要で、Y トークンを消費し、現在のAPIレートで約 $Z のコストがかかりました。
  • ビデオ映像では、車が低速でコーンの列に沿ってスムーズに走行し、衝突前に停止する様子が確認できます。

注: スクレイピングされたページでは指標の説明が繰り返されているため、正確な数値はソースに含まれていません。

コミュニティの分析: レイテンシが最大の障壁

クラウドのレイテンシが現実世界での実現可能性を阻害

"クラウドサービスに光速のRTTを1回追加するだけでも致命的です…その頃には車の周囲の状況は変化してしまっています。" – jyoung8607 (元openpilotコントリビューター)

Open-pilotの更新は 20 Hz(50msごと)で曲率と加速度をターゲットにしています。クラウドベースのLLMは 数百ミリ秒 オーダーの往復時間を発生させ、動的な交通環境で安全に動作するために必要な制御ループの許容範囲を大幅に超えています。

ハードウェア・イン・ザ・ループは依然として必須

"Teslaや他の自動運転メーカーが車内にコンピューティングハードウェアを必要とするのには理由があります。" – jyoung8607

たとえLLMが完璧なステアリングコマンドを生成できたとしても、生のカメラフレームをリモートモデルに送信し、推論を待ち、アクチュエーションコマンドを返送するレイテンシにより、静的で低速なコース以外ではシステムは使用不能になります。

レイテンシが唯一の残された障害であるという意見も

"現時点では主にレイテンシの問題です。モデルが大きすぎてローカルで実行できませんが、Qwenのようなオープンウェイトモデルが既に存在することを考えると、Astraと同等の低レイテンシなオープンウェイトモデルが登場するのもそう遠くないでしょう。" – valine

コミュニティは、技術的な核心的課題はモデルの能力ではなく、デバイス上でのリアルタイム推論であるという点で一致しています。

議論から得られたその他の観察

  • 視覚能力: コメンテーターは、Astraが視覚重視のベンチマーク(ARC-3、SpatialBenchなど)で強力なパフォーマンスを発揮していることに注目し、そのマルチモーダル学習が運転の成功に寄与していると推測しています。
  • ツール利用の枠組み: 一部のユーザーは、このベンチマークを専門的な認識パイプラインではなく、汎用的なツールユーザーとしてのLLMのデモンストレーションと捉えています。
  • 安全性と責任: 予測不可能な動作や法的リスクを挙げ、公道でこのようなシステムを展開することに対して警告するユーザーもいます。
  • ベンチマークの新規性: コミュニティはベンチマークとしては面白いと評価していますが、実際の自動運転スタックとの関連性には疑問を呈しています。

このベンチマークがAI研究にとって重要な理由

  1. マルチモーダル統合の証明: Astraは視覚入力を取り込み、言語で推論し、低レベルの制御信号を出力できるため、統合された知覚・行動モデルへの一歩を示しています。
  2. ツール利用パイプライン: この実験は、車をLLMが呼び出せるツールとして扱っており、外部APIをオーケストレーションするLLMに関する最新の研究と一致しています。
  3. 指標の透明性: 試行進捗、トークン使用量、コストを公開することで、DrivingBenchは将来のモデルを比較するための再現可能なフレームワークを提供しています。

制限事項と未解決の疑問

  • スケーラビリティ: このベンチマークは単純なコーンコースでの低速走行であり、交通、歩行者、複雑な道路形状との相互作用はテストされていません。
  • レイテンシ測定: 公開データにはエンドツーエンドのレイテンシ数値が含まれておらず、それなしではリアルタイムの実現可能性を評価することは不可能です。
  • 安全性の保証: 正式な検証やフェイルセーフメカニズムは記述されておらず、システムは人間の監視に依存しています。
  • コスト: リスト価格のトークンレートでは、1回の走行に数ドルかかり、大規模なテストには高額すぎる可能性があります。

今後の展望

DrivingBenchは、GPT-6 AstraのようなフロンティアLLMが、制約された環境下で技術的に実車を制御できることを示しており、マルチモーダルAIの重要なマイルストーンとなりました。しかし、Hacker Newsでのコンセンサスは明確です。レイテンシと安全性は、クラウドベースのLLMを現実世界の自動運転に展開するための克服不可能な障壁であり続けています。今後の進歩は、同等のモデル容量をエッジハードウェアにもたらすか、高速な知覚スタックと高レベルのLLM推論を組み合わせたハイブリッドシステムを設計することにかかっているでしょう。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch