LeRobotDataset v3.0 版本說明 / 新功能
Hugging Face 已發布 LeRobotDataset:v3.0,這是一種為機器人學習設計的標準化資料集格式,旨在擴展至數百萬個情節。此更新透過將多個情節打包至單一檔案,解決了 2.0 版中發現的檔案系統限制,並引入原生串流模式,以在不需完整本機下載的情況下處理大型資料集。
可擴展的資料儲存架構
LeRobotDataset:v3.0 從每檔案一個情節的方式轉變為串接儲存模型,以減少本地與遠端檔案系統的壓力。此格式將資料組織為三個主要支柱:
- 表格資料:低維度、高頻率的資料(例如關節狀態與動作)儲存在 Apache Parquet 檔案中。這些檔案可透過
datasets函式庫以快速記憶體映射或串流方式存取。 - 視覺資料:相機影格被串接並編碼為 MP4 檔案。多個情節被合併至單一影片檔,且多個影片依相機視角分組。為進一步優化檔案系統效能,這些檔案被組織於子目錄中。
- 中繼資料:JSON 檔案作為關聯層,對映表格與視覺資料。內容包括特徵結構、影格率、正規化統計以及情節邊界。
資料集儲存庫結構
為在串接儲存的情況下仍能保持單一情節層級的檢索效率,儲存庫採用以下結構:
meta/info.json:定義特徵(例如observation.state、action)、形狀、資料類型、FPS 與路徑模板的核心結構。meta/stats.json:每個特徵的聚合統計(平均值、標準差、最小值、最大值),用於資料正規化。meta/tasks.jsonl:將自然語言任務描述映射至整數索引,以供任務條件化策略訓練使用。meta/episodes/:儲存情節特定中繼資料(長度、任務、資料指標)的分塊 Parquet 檔案。data/:核心逐框表格資料的 Parquet 檔案,將多個情節的資料串接成較大的檔案。videos/:包含多個情節串接影像的 MP4 檔案,依相機鍵與分塊組織。
串流與資料存取
LeRobotDataset:v3.0 引入 StreamingLeRobotDataset 介面,使用者可即時直接從 Hugging Face Hub 處理資料批次,無需將整個集合下載至磁碟。
對於標準本機存取,LeRobotDataset 類別與 PyTorch DataLoader 整合。它支援透過 delta_timestamps 參數的原生視窗操作,允許使用者取得在給定影格前後特定秒數內的觀測與動作堆疊——這是強化學習 (RL) 與行為克隆 (BC) 演算法的關鍵需求。
移轉與安裝
LeRobotDataset:v3.0 將正式整合至 lerobot-v0.4.0 穩定版。使用者目前可透過 lerobot-v0.3.x 的預發布版本存取此格式。
若要將現有的 v2.1 資料集遷移至 v3.0,Hugging Face 提供一個轉換工具,可將單一情節檔案彙整為新式的串接格式並更新中繼資料:
python -m lerobot.datasets.v30.convert_dataset_v21_to_v30 --repo-id=<HFUSER/DATASET_ID>
支援的實體
此格式設計具可擴充性,且目前支援廣泛的機器人資料,包括:
- 機械手臂平台(例如 SO-100 手臂、ALOHA-2 設定)
- 真實世界的人形機器人資料
- 模擬資料集
- 自駕車資料