LeRobot 社群資料集:打造機器人領域的 ImageNet

Hugging Face 正在透過 LeRobot 建立一個社群驅動的開源機器人資料集生態系統,以應對視覺‑語言‑動作(Vision-Language-Action,VLA)模型在泛化方面的關鍵挑戰。透過將焦點從模型架構轉移到資料多樣性,LeRobot 旨在打造機器人領域的 ImageNet,讓機器人能在全新環境、物件與場景中執行任務。

泛化作為資料問題

機器人領域的泛化——在未見過的環境與新穎物件中執行任務的能力——主要是一種資料現象,而非模型屬性。雖然 VLA 模型能完成摺衣服或抓取立方體等任務,但它們適應新環境的能力受限於多樣化訓練資料的可得性。

為了實現通用政策,模型必須在異質資料集上共同訓練。此過程使模型能抽象出更廣泛的模式,並理解不僅是如何行動,還有場景與目標背後的「為何」原因。目前的進展常受阻,因為大多數機器人資料來自結構化的學術實驗室,缺乏如 ImageNet 這類互聯網規模資料集所具備的真實世界多樣性。

LeRobot 社群方法

LeRobot 正在透過簡化錄製流程、降低硬體成本、並精簡上傳至 Hugging Face Hub 的步驟,使機器人資料收集民主化。此舉旨在突破孤立實驗室的「資料孤島」,打造全球共享的基礎建設。

目前,資料集領域主要被機械手臂與操作任務所主導,特別是使用 So100 與 Koch 機器人。然而,此計畫亦延伸至其他領域,包括:

  • 自駕車
  • 輔助機器人
  • 移動導航

值得注意的社群貢獻已包括精確的家用抽屜操作資料集、透過立體相機捕捉的完整棋局,以及與彩色動物模型的互動資料。

機器人基礎模型的資料金字塔

真實世界的資料是將抽象先驗與具體物理行動結合的關鍵「結合組織」。為了最佳化訓練,LeRobot 參考了一個資料金字塔結構(改編自 Gr00t),其中文件量隨具體化程度的提升而遞減:

  1. 基礎層:大規模的網路與影片資料。
  2. 模擬多樣性:合成資料。
  3. 實體執行:位於金字塔頂端的真實世界機器人互動。

提升真實世界互動的數量與多樣性可縮小模擬到實體的差距,並在結構上加強金字塔各層之間的連結,從而產生更穩健且具能力的政策。

社群資料策展的挑戰

隨著社群貢獻資料量的增加,Hugging Face 在目前的策展流程中發現了四大主要挑戰:

  1. 任務註解不一致:許多資料集的任務描述為空、過於簡短(例如「Up」)或含糊不清,妨礙認知系統理解情境的能力。
  2. 特徵映射不一致:相機視角標記含糊(例如使用 images.laptop 而未說明是第三人稱視角或手腕視角)。
  3. 低品質片段:出現僅有極少幀數或因刪除檔案未重新索引而導致序列一致性中斷的片段。
  4. 維度不一致:即使使用相同的機器人硬體(例如 So100),動作或狀態的維度仍可能不同。

高品質機器人資料的最佳實踐

為提升社群資料集的實用性,LeRobot 提供了一套標準化的資料收集檢查清單:

影像與影片品質

  • 視角:建議使用兩個相機視角,且解析度要高(至少 480x640 / 720p)。
  • 穩定性:確保影片拍攝平穩不抖動,並保持中性、穩定的光線。
  • 構圖:領先手臂不應出現在畫面中;僅顯示跟隨手臂與被操作的物件。
  • 背景:使用靜態且不具干擾性的背景。

中繼資料與命名規則

  • FPS:影片錄製的幀率約為每秒 30 幀。
  • 命名慣例:使用 <modality>.<location> 格式(例如 images.topimages.wrist.left),避免使用裝置特定的名稱如 images.phone
  • 機器人類型:在中繼資料中確保選擇正確的機器人類型,並參考 LeRobot 設定註冊表以保持一致性。

任務註解

  • 清晰度:使用 task 欄位清楚描述目標(例如「挑選黃色的樂高積木並放入盒子」)。
  • 長度:描述應簡潔,通常介於 25–50 個字元,避免使用像「task1」這樣的通用標籤。

Sources