LeRobotDataset 视频编码格式降低机器人数据集大小并加快训练速度

TL;DR

Hugging Face 推出了 LeRobotDataset 格式,该格式将机器人视觉数据存储为压缩视频流,使数据集大小平均降至原始的 14%,同时保持加载速度快且训练性能不变。

什么是机器人数据集以及为何视频有帮助

机器人端到端学习的数据集包含两种模态:(1) 视觉流(相机图像)和 (2) 本体感受或目标位置向量(状态/动作)。历史上,视觉帧通常保存为单独的 PNG 文件,这会产生大量冗余,因为相邻帧共享大量相似区域。视频编解码器利用 空间压缩(如 JPEG)和 时间压缩(仅存储帧间差异)实现 1:20 或更高的压缩比。通过将视觉模态编码为视频,能够在原始体积的一小部分中存储相同信息,并且在训练时仍能快速解码。

LeRobotDataset 的贡献

  • Simple – 每个 episode 只需一个视频文件,加上一个轻量级的元数据文件。
  • Lightweight – 平均存储仅为原始图像大小的 14 %(部分数据集可压缩至 <1 %)。
  • Fast to load – 解码单帧的速度可与加载 PNG 相当;解码多个连续帧仅需 PNG 同等数量所需时间的 25 %–50 %。
  • Easy to share – 与 Hugging Face Hub 原生集成,便于共享。
  • Easy to visualize – 交互式 Spaces 让用户浏览视频及其对应的动作。

视频编码原理(编解码器基础)

视频编码通过两种机制实现尺寸缩减:

  1. 空间压缩 – 利用图像内部的模式(例如大面积的天空)对每帧进行压缩。
  2. 时间压缩 – 仅存储帧间差异(P‑帧/B‑帧),相对于周期性的 关键帧(I‑帧)。

编码后的比特流随后被封装在如 MP4 的容器中。作者构建了一个基准(见 GitHub 仓库),用于评估不同的编解码器选择、像素格式、GOP 大小以及恒定码率因子(CRF)设置。

评估标准

  • Size – 更小的文件可降低存储和下载成本。
  • Decoding time – 更快的帧提取速度加速训练。
  • Quality – 需要高视觉保真度以避免降低策略性能。
  • Compatibility – 视频必须能够在浏览器和常见媒体播放器上播放;像素格式 yuv420p 满足此要求。

基准变量与数据集

研究使用了四个具有代表性的数据集,涵盖了不同分辨率和场景动态:

数据集 分辨率 场景类型
lerobot/pusht_image 96 × 96 模拟几何形状
aliberts/aloha_mobile_shrimp_image 480 × 640 真实室内,摄像头移动
aliberts/paris_street 720 × 1280 真实室外,摄像头移动
aliberts/kitchen 1080 × 1920 真实室内,摄像头固定

探索的编码参数包括三种编解码器(libx264libx265libsvtav1)、两种像素格式(yuv444pyuv420p)、GOP 大小从 1 到 40,以及 CRF 值从 0(无损)到 50(高度有损)。

生产环境选定设置(v1.6)

在基准测试之后,团队为已发布的数据集(v1.6)确定了以下配置:

  • Codec: libsvtav1(AV1 实现)
  • Pixel format: yuv420p
  • GOP size: 2(每隔一帧为关键帧)
  • CRF: 30(质量与压缩的平衡)

这些设置相较于之前基于 libx264 的 v1.5 提升了视觉质量,同时保持了兼容性。

实现的尺寸缩减

在 70 多个公开机器人数据集中,平均压缩比例为原始大小的 14 %。当源图像为未压缩时,部分数据集甚至缩小至原始大小的 0.2 %。示例缩减:

  • lerobot/nyu_rot_dataset:5.3 MB → 318 KB(5.8 %)
  • lerobot/utokyo_xarm_pick_and_place:1.3 GB → 54.6 MB(4.1 %)
  • lerobot/berkeley_gnm_recon*:18.7 GB → 29.3 MB(0.2 %)

完整表格请参见原博客文章。

加载时间性能

使用视频时,加载时间随分辨率的增长表现更佳。在 优势 场景(多个连续帧)下,解码时间仅为 PNG 基准的 4 %–48 %,具体取决于分辨率和编解码器。源文档中的图表显示 2 帧和 6 帧批次具有明显优势。

质量指标

作者在解码帧上测量了三项标准图像质量指标:

  • MSE(越低越好)
  • PSNR(越高越好)
  • SSIM(越高越好)

在四个基准数据集中,libsvtav1 配合 yuv420pcrf=30 始终实现最高的 PSNR 与 SSIM,同时保持低 MSE。例如,在 aliberts/kitchen 数据集上,AV1 达到 PSNR = 39.20 dBSSIM = 96.84 %,优于 H.264 与 H.265。

对策略训练的影响

对两种代表性策略的训练曲线——pusht 数据集上的 Diffusion 和 aloha 数据集上的 ACT——在使用视频编码格式时未出现性能下降。曲线与使用原始 PNG 数据得到的曲线重合,证实压缩不会影响学习。

未来方向

当前基准测试未涉及多种编码参数(例如 -preset-tune、双遍编码)以及替代解码器(torchcodecdecord 等)。对这些进行探索可能进一步优化尺寸‑质量‑速度的平衡。此外,将深度图与 RGB 帧一起编码仍是一个待解决的问题。

为什么这很重要

通过将视觉数据压缩为高效的视频流,Hugging Face 使大规模机器人学习数据集的存储、共享和训练变得可行。该方法缩小了机器人领域与其他已经受益于海量互联网数据的 AI 领域之间的差距,可能加速端到端机器人策略学习的研究。

Sources