LeRobotDataset 视频编码格式降低机器人数据集大小并加快训练速度
TL;DR
Hugging Face 推出了 LeRobotDataset 格式,该格式将机器人视觉数据存储为压缩视频流,使数据集大小平均降至原始的 14%,同时保持加载速度快且训练性能不变。
什么是机器人数据集以及为何视频有帮助
机器人端到端学习的数据集包含两种模态:(1) 视觉流(相机图像)和 (2) 本体感受或目标位置向量(状态/动作)。历史上,视觉帧通常保存为单独的 PNG 文件,这会产生大量冗余,因为相邻帧共享大量相似区域。视频编解码器利用 空间压缩(如 JPEG)和 时间压缩(仅存储帧间差异)实现 1:20 或更高的压缩比。通过将视觉模态编码为视频,能够在原始体积的一小部分中存储相同信息,并且在训练时仍能快速解码。
LeRobotDataset 的贡献
- Simple – 每个 episode 只需一个视频文件,加上一个轻量级的元数据文件。
- Lightweight – 平均存储仅为原始图像大小的 14 %(部分数据集可压缩至 <1 %)。
- Fast to load – 解码单帧的速度可与加载 PNG 相当;解码多个连续帧仅需 PNG 同等数量所需时间的 25 %–50 %。
- Easy to share – 与 Hugging Face Hub 原生集成,便于共享。
- Easy to visualize – 交互式 Spaces 让用户浏览视频及其对应的动作。
视频编码原理(编解码器基础)
视频编码通过两种机制实现尺寸缩减:
- 空间压缩 – 利用图像内部的模式(例如大面积的天空)对每帧进行压缩。
- 时间压缩 – 仅存储帧间差异(P‑帧/B‑帧),相对于周期性的 关键帧(I‑帧)。
编码后的比特流随后被封装在如 MP4 的容器中。作者构建了一个基准(见 GitHub 仓库),用于评估不同的编解码器选择、像素格式、GOP 大小以及恒定码率因子(CRF)设置。
评估标准
- Size – 更小的文件可降低存储和下载成本。
- Decoding time – 更快的帧提取速度加速训练。
- Quality – 需要高视觉保真度以避免降低策略性能。
- Compatibility – 视频必须能够在浏览器和常见媒体播放器上播放;像素格式
yuv420p满足此要求。
基准变量与数据集
研究使用了四个具有代表性的数据集,涵盖了不同分辨率和场景动态:
| 数据集 | 分辨率 | 场景类型 |
|---|---|---|
lerobot/pusht_image |
96 × 96 | 模拟几何形状 |
aliberts/aloha_mobile_shrimp_image |
480 × 640 | 真实室内,摄像头移动 |
aliberts/paris_street |
720 × 1280 | 真实室外,摄像头移动 |
aliberts/kitchen |
1080 × 1920 | 真实室内,摄像头固定 |
探索的编码参数包括三种编解码器(libx264、libx265、libsvtav1)、两种像素格式(yuv444p、yuv420p)、GOP 大小从 1 到 40,以及 CRF 值从 0(无损)到 50(高度有损)。
生产环境选定设置(v1.6)
在基准测试之后,团队为已发布的数据集(v1.6)确定了以下配置:
- Codec:
libsvtav1(AV1 实现) - Pixel format:
yuv420p - GOP size: 2(每隔一帧为关键帧)
- CRF: 30(质量与压缩的平衡)
这些设置相较于之前基于 libx264 的 v1.5 提升了视觉质量,同时保持了兼容性。
实现的尺寸缩减
在 70 多个公开机器人数据集中,平均压缩比例为原始大小的 14 %。当源图像为未压缩时,部分数据集甚至缩小至原始大小的 0.2 %。示例缩减:
lerobot/nyu_rot_dataset:5.3 MB → 318 KB(5.8 %)lerobot/utokyo_xarm_pick_and_place:1.3 GB → 54.6 MB(4.1 %)lerobot/berkeley_gnm_recon*:18.7 GB → 29.3 MB(0.2 %)
完整表格请参见原博客文章。
加载时间性能
使用视频时,加载时间随分辨率的增长表现更佳。在 优势 场景(多个连续帧)下,解码时间仅为 PNG 基准的 4 %–48 %,具体取决于分辨率和编解码器。源文档中的图表显示 2 帧和 6 帧批次具有明显优势。
质量指标
作者在解码帧上测量了三项标准图像质量指标:
- MSE(越低越好)
- PSNR(越高越好)
- SSIM(越高越好)
在四个基准数据集中,libsvtav1 配合 yuv420p 与 crf=30 始终实现最高的 PSNR 与 SSIM,同时保持低 MSE。例如,在 aliberts/kitchen 数据集上,AV1 达到 PSNR = 39.20 dB 和 SSIM = 96.84 %,优于 H.264 与 H.265。
对策略训练的影响
对两种代表性策略的训练曲线——pusht 数据集上的 Diffusion 和 aloha 数据集上的 ACT——在使用视频编码格式时未出现性能下降。曲线与使用原始 PNG 数据得到的曲线重合,证实压缩不会影响学习。
未来方向
当前基准测试未涉及多种编码参数(例如 -preset、-tune、双遍编码)以及替代解码器(torchcodec、decord 等)。对这些进行探索可能进一步优化尺寸‑质量‑速度的平衡。此外,将深度图与 RGB 帧一起编码仍是一个待解决的问题。
为什么这很重要
通过将视觉数据压缩为高效的视频流,Hugging Face 使大规模机器人学习数据集的存储、共享和训练变得可行。该方法缩小了机器人领域与其他已经受益于海量互联网数据的 AI 领域之间的差距,可能加速端到端机器人策略学习的研究。