commaai/commavq
A dataset of 100,000 minutes of driving video compressed using a VQ-VAE.
해결하는 문제
과거 관측과 행동을 기반으로 환경의 미래 상태를 예측할 수 있는 세계 모델을 구축하기 위한 프레임워크와 데이터셋을 제공합니다. 이는 자율주행차와 같은 지능형 에이전트를 훈련시키는 데 필수적입니다.
작동 방식
이 프로젝트는 VQ-VAE를 사용하여 동영상을 이산 토큰으로 압축합니다. 이후 300만 분의 주행 동영상 데이터셋을 활용해 GPT 기반의 세계 모델을 훈련시켜 시퀀스에서 다음 토큰을 예측함으로써 미래 프레임을 '상상'합니다.
대상 사용자
세계 모델, 동영상 압축, 자율주행 에이전트 개발에 종사하는 연구자 및 개발자.
주요 특징
- 대규모 데이터셋: 압축된 주행 동영상 10만 분과 300만 분의 데이터로 훈련된 세계 모델 포함.
- 토큰화: 각 프레임을 128개의 10비트 토큰으로 줄이는 데 VQ-VAE 사용.
- 예측 모델링: 미래 세계 상태를 예측하기 위해 GPT 기반 아키텍처 활용.
- 압축 챌린지: 주행 동영상 토큰의 무손실 압축을 위한 챌린지 포함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트