commaai/commavq
A dataset of 100,000 minutes of driving video compressed using a VQ-VAE.
解决的问题
提供一个框架和数据集,用于构建能够基于先前观测和动作预测环境未来状态的世界模型,这对于训练智能体(如自动驾驶汽车)至关重要。
工作原理
该项目使用 VQ-VAE 将视频帧压缩为离散的标记。随后,使用包含 300 万分钟驾驶视频的数据集,训练一个以生成式预训练变换器(GPT)实现的世界模型,通过预测序列中的下一个标记,从而“想象”出未来的帧。
适用人群
从事世界模型、视频压缩和自动驾驶智能体的研究人员和开发者。
主要亮点
- 大规模数据集:包含 10 万分钟压缩后的驾驶视频,以及在 300 万分钟数据上训练的世界模型。
- 标记化:使用 VQ-VAE 将每帧压缩为 128 个 10 位的标记。
- 预测建模:采用 GPT 基础架构预测未来的世界状态。
- 压缩挑战:包含针对驾驶视频标记的无损压缩挑战。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目