LeRobotDataset 影片編碼格式減少機器人資料集大小並加速訓練
TL;DR
Hugging Face 推出了 LeRobotDataset 格式,將機器人的視覺資料儲存為壓縮影片串流,將資料集大小縮減至原始的約 14 %,同時保持載入速度快速且訓練效能不變。
什麼是機器人資料集以及為何影片有幫助
用於端到端學習的機器人資料集包含兩種模態:(1) 視覺串流(相機影像)以及 (2) 本體感受或目標位置向量(狀態/動作)。過去視覺影格會以單獨的 PNG 檔案儲存,這樣會產生高度冗餘,因為連續的影格共享大量相似區域。影片編解碼器利用 空間壓縮(如 JPEG)與 時間壓縮(僅儲存影格間差異)來達成 1:20 或更佳的壓縮比。將視覺模態編碼為影片後,能以原始大小的一小部分儲存相同資訊,且仍能快速解碼供訓練使用。
LeRobotDataset 的貢獻
- Simple – 每個 episode 只需一個影片檔案,外加一個輕量的 metadata 檔案。
- Lightweight – 平均儲存量為原始影像大小的 14 %(某些資料集可縮減至 <1 %)。
- Fast to load – 解碼單一影格的速度可與載入 PNG 相當;解碼多個連續影格僅需 PNG 相同數量的 25 %–50 % 時間。
- Easy to share – 可直接與 Hugging Face Hub 整合分享。
- Easy to visualize – 互動式 Spaces 讓使用者瀏覽影片及相關動作。
影片編碼運作原理(編解碼器基礎)
影片編碼透過兩種機制減少大小:
- Spatial compression – 使用影像內的模式(例如廣闊的天空區域)壓縮每一影格。
- Temporal compression – 只儲存影格之間的差異(P‑frames/B‑frames),相對於週期性的 keyframes(I‑frames)。
編碼後的位元串流會被封裝在如 MP4 的容器中。作者建立了一個基準測試(見 GitHub repo),用以評估不同的編解碼器選擇、像素格式、GOP 大小以及 constant‑rate‑factor(CRF)設定。
評估標準
- Size – 較小的檔案可降低儲存與下載成本。
- Decoding time – 更快的影格提取可加速訓練。
- Quality – 需要高視覺保真度以避免降低策略效能。
- Compatibility – 影片必須能在瀏覽器與常見媒體播放器上播放;像素格式
yuv420p符合此需求。
基準變數與資料集
本研究使用了四個具代表性的資料集,涵蓋不同解析度與場景動態:
| 資料集 | 解析度 | 場景類型 |
|---|---|---|
lerobot/pusht_image |
96 × 96 | 模擬幾何形狀 |
aliberts/aloha_mobile_shrimp_image |
480 × 640 | 真實室內,移動相機 |
aliberts/paris_street |
720 × 1280 | 真實戶外,移動相機 |
aliberts/kitchen |
1080 × 1920 | 真實室內,固定相機 |
探索的編碼參數包括三種編解碼器(libx264、libx265、libsvtav1)、兩種像素格式(yuv444p、yuv420p)、GOP 大小從 1 到 40,以及 CRF 值從 0(無損)到 50(高度有損)。
生產環境的選擇設定(v1.6)
在基準測試之後,團隊為已發布的資料集(v1.6)確定了以下配置:
- Codec:
libsvtav1(AV1 實作) - Pixel format:
yuv420p - GOP size: 2(每兩影格一個關鍵影格)
- CRF: 30(品質與壓縮的平衡)
這些設定相較於先前基於 libx264 的 v1.5 提升了視覺品質,同時保持相容性。
已實現的大小縮減
在超過 70 個公開機器人資料集中,平均壓縮比例為原始大小的 14 %。若原始影像未壓縮,部分資料集可縮減至 0.2 %。以下為範例縮減:
lerobot/nyu_rot_dataset:5.3 MB → 318 KB(5.8 %)lerobot/utokyo_xarm_pick_and_place:1.3 GB → 54.6 MB(4.1 %)lerobot/berkeley_gnm_recon*:18.7 GB → 29.3 MB(0.2 %)
完整表格請參見原始部落格文章。
載入時間效能
使用影片時,載入時間隨解析度的變化更為良好。在 advantageous(有利)情境(多個連續影格)下,解碼時間僅為 PNG 基線的 4 %–48 %,具體取決於解析度與編解碼器。來源中的圖表顯示 2 影格與 6 影格批次明顯具有優勢。
品質指標
作者在解碼的影格上測量了三項標準影像品質指標:
- MSE(越低越好)
- PSNR(越高越好)
- SSIM(越高越好)
對於四個基準資料集,libsvtav1 搭配 yuv420p 與 crf=30 持續取得最佳的 PSNR 與 SSIM,同時保持低 MSE。例如,在 aliberts/kitchen 資料集上,AV1 獲得 PSNR = 39.20 dB 與 SSIM = 96.84 %,優於 H.264 與 H.265。
對策略訓練的影響
對兩個具代表性的策略(pusht 資料集上的 Diffusion 與 aloha 資料集上的 ACT)的訓練曲線在使用影片編碼格式時未出現退化。曲線與使用原始 PNG 資料得到的曲線重疊,證實壓縮不會影響學習。
未來方向
目前的基準測試未涵蓋多項編碼參數(例如 -preset、-tune、雙通道編碼)以及其他解碼器(torchcodec、decord 等)。探索這些項目可能進一步提升大小‑品質‑速度的權衡。此外,將深度圖與 RGB 影格同時編碼仍是未解決的問題。
為何此事重要
透過將視覺資料壓縮成高效的影片串流,Hugging Face 使大規模機器人學習資料集在儲存、分享與訓練上變得實用。此方法縮小了機器人領域與其他已受益於大規模網路資料的 AI 領域之間的差距,可能加速端到端機器人策略學習的研究。