LeRobot コミュニティ データセット: ロボティクスの ImageNet を構築する

Hugging Face は、LeRobot を通じてオープンソースのロボティクスデータセットのコミュニティ主導エコシステムを構築し、Vision‑Language‑Action (VLA) モデルにおける汎化という重要な課題に取り組んでいます。モデルアーキテクチャからデータの多様性へ焦点をシフトすることで、LeRobot はロボティクス版 ImageNet の創出を目指し、ロボットが新しい設定や物体、環境でタスクを実行できるようにします。

汎化はデータの問題

ロボティクスにおける汎化—未見の環境や新規オブジェクトでタスクを実行できる能力—は、モデルの性質というよりもデータの現象です。VLA モデルは洗濯物をたたむ、立方体を掴むといったタスクはこなせますが、新しい設定に適応する力は、多様な学習データの有無に左右されます。

汎用的なポリシーを実現するには、モデルを異種データセットで共同学習させる必要があります。このプロセスにより、モデルは広範なパターンを抽象化し、単に「どう行動するか」だけでなく、シーンや目標の背後にある「なぜ」を理解できるようになります。現在の進展は、多くのロボティクスデータが構造化された学術ラボから来ており、ImageNet のようなインターネット規模のデータセットに見られる実世界の多様性が欠如しているため、しばしば阻まれています。

LeRobot コミュニティアプローチ

LeRobot は、記録パイプラインを簡素化し、ハードウェアコストを削減し、Hugging Face Hub へのアップロードをスムーズにすることで、ロボティクスデータ収集の民主化を進めています。この取り組みは、孤立したラボの「データアイランド」から脱却し、グローバルで共有可能なインフラを構築することを目指しています。

現在、データセットの風景はロボットアームと操作タスクが中心で、主に So100 と Koch ロボットが使用されています。しかし、イニシアティブは以下のような他領域にも拡大しています:

  • Autonomous vehicles
  • Assistive robots
  • Mobile navigation

すでに注目すべきコミュニティ貢献として、家庭用引き出しの精密操作データセット、ステレオカメラで撮影されたチェス対局全体、カラフルな動物フィギュアとのインタラクションなどがあります。

ロボット基盤モデルのためのデータピラミッド

実世界データは、抽象的な事前知識と具体的な物理行動を結びつける重要な「結合組織」です。トレーニングを最適化するために、LeRobot は Gr00t から着想を得たデータピラミッド構造を参照しています。データ量は、具現化の具体性が高まるにつれて減少します:

  1. Foundation: 大規模なウェブ・動画データ。
  2. Simulated Diversity: 合成データ。
  3. Physical Execution: 実世界ロボットインタラクション(最上位)。

実世界でのインタラクションの量と多様性を増やすことで、シミュレーションから実世界へのギャップが縮まり、ピラミッドのすべての層間の結びつきが構造的に強化され、より頑健で有能なポリシーが実現します。

コミュニティデータキュレーションの課題

コミュニティから提供されるデータ量が増加するにつれ、Hugging Face は現在のキュレーションパイプラインにおいて 4 つの主要課題を特定しました:

  1. タスク注釈の不整合: 多くのデータセットでタスク記述が空、極端に短い(例: "Up")または曖昧であり、認知システムが文脈を理解しにくくなっています。
  2. 特徴マッピングの不整合: カメラビューのラベリングが曖昧(例: images.laptop を使用し、第三者視点か手首視点かが不明)です。
  3. 低品質エピソード: フレーム数が極端に少ないエピソードや、削除されたファイルが再インデックスされずに生じるシーケンスの破綻があります。
  4. 次元の不整合: 同一ロボットハードウェア(例: So100)を使用していても、アクションや状態の次元が揃っていないケースがあります。

高品質ロボティクスデータのベストプラクティス

コミュニティデータセットの有用性を高めるために、LeRobot はデータ収集の標準チェックリストを提供しています:

画像・動画の品質

  • ビュー: 可能であれば 2 つのカメラビューを使用し、高解像度(最低 480x640 / 720p)で撮影します。
  • 安定性: 手ブレのない安定した動画撮影を行い、ニュートラルで安定した照明を保ちます。
  • 構図: リーダーアームがフレームに入らないようにし、フォロワーアームと操作対象のみが映るようにします。
  • 背景: 静的で目立たない背景を使用します。

メタデータと命名規則

  • FPS: 動画はおおよそ 30 フレーム/秒で記録します。
  • 命名規則: <modality>.<location> 形式を使用します(例: images.topimages.wrist.left)。images.phone のようなデバイス固有の名前は避けます。
  • ロボット種別: メタデータで正しいロボット種別が選択されていることを確認し、LeRobot の config レジストリを参照して一貫性を保ちます。

タスク注釈

  • 明確さ: task フィールドで目的を明確に記述します(例: "黄色のレゴブロックを拾って箱に入れる")。
  • 長さ: 説明は概ね 25〜50 文字に収め、"task1" のような汎用ラベルは避けます。

Sources