commaai/commavq

A dataset of 100,000 minutes of driving video compressed using a VQ-VAE.

何を解決するか

過去の観測と行動に基づいて環境の将来の状態を予測できる世界モデルの構築を可能にするフレームワークとデータセットを提供します。これは、自律走行車のような知能エージェントの訓練に不可欠です。

動作方法

このプロジェクトでは、VQ-VAE を使って動画フレームを離散的なトークンに圧縮します。その後、300万分の走行動画データセットを用いて、生成的事前学習Transformer(GPT)として実装された世界モデルをこれらのトークン上で訓練し、シーケンスにおける次のトークンを予測することで、将来のフレームを「想像」します。

対象ユーザー

世界モデル、動画圧縮、自律走行エージェントの開発に取り組む研究者や開発者。

特徴

  • 大規模データセット: 圧縮された走行動画10万分と、300万分のデータで訓練された世界モデルを含む。
  • トークン化: 各フレームを128トークン(10ビットずつ)に圧縮するためのVQ-VAEを使用。
  • 予測モデリング: 将来の世界状態を予測するためのGPTベースのアーキテクチャを採用。
  • 圧縮チャレンジ: 走行動画トークンの無損失圧縮を対象とするチャレンジを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト