commaai/commavq
A dataset of 100,000 minutes of driving video compressed using a VQ-VAE.
解決的問題
提供一個框架與資料集,用於建立能根據先前觀測與動作預測環境未來狀態的世界模型,這對於訓練智慧型代理(如自駕車)至關重要。
作法原理
本專案使用 VQ-VAE 將影片幀壓縮為離散的標記。接著,利用包含 300 萬分鐘駕駛影片的資料集,訓練一個以生成式預訓練轉換器(GPT)實現的世界模型,透過預測序列中的下一個標記,進而「想像」未來的畫面。
適用對象
從事世界模型、影片壓縮與自駕智慧代理的研究人員與開發者。
主要亮點
- 大型資料集:包含 10 萬分鐘壓縮後的駕駛影片,以及在 300 萬分鐘資料上訓練的世界模型。
- 標記化:使用 VQ-VAE 將每幀壓縮為 128 個 10 位的標記。
- 預測建模:採用 GPT 基礎架構預測未來的世界狀態。
- 壓縮挑戰:包含針對駕駛影片標記的無損壓縮挑戰。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案