LeRobot コミュニティ データセット: ロボティクスの ImageNet を構築する
Hugging Face は、LeRobot を通じてオープンソースのロボティクスデータセットのコミュニティ主導エコシステムを構築し、Vision‑Language‑Action (VLA) モデルにおける汎化という重要な課題に取り組んでいます。モデルアーキテクチャからデータの多様性へ焦点をシフトすることで、LeRobot はロボティクス版 ImageNet の創出を目指し、ロボットが新しい設定や物体、環境でタスクを実行できるようにします。
汎化はデータの問題
ロボティクスにおける汎化—未見の環境や新規オブジェクトでタスクを実行できる能力—は、モデルの性質というよりもデータの現象です。VLA モデルは洗濯物をたたむ、立方体を掴むといったタスクはこなせますが、新しい設定に適応する力は、多様な学習データの有無に左右されます。
汎用的なポリシーを実現するには、モデルを異種データセットで共同学習させる必要があります。このプロセスにより、モデルは広範なパターンを抽象化し、単に「どう行動するか」だけでなく、シーンや目標の背後にある「なぜ」を理解できるようになります。現在の進展は、多くのロボティクスデータが構造化された学術ラボから来ており、ImageNet のようなインターネット規模のデータセットに見られる実世界の多様性が欠如しているため、しばしば阻まれています。
LeRobot コミュニティアプローチ
LeRobot は、記録パイプラインを簡素化し、ハードウェアコストを削減し、Hugging Face Hub へのアップロードをスムーズにすることで、ロボティクスデータ収集の民主化を進めています。この取り組みは、孤立したラボの「データアイランド」から脱却し、グローバルで共有可能なインフラを構築することを目指しています。
現在、データセットの風景はロボットアームと操作タスクが中心で、主に So100 と Koch ロボットが使用されています。しかし、イニシアティブは以下のような他領域にも拡大しています:
- Autonomous vehicles
- Assistive robots
- Mobile navigation
すでに注目すべきコミュニティ貢献として、家庭用引き出しの精密操作データセット、ステレオカメラで撮影されたチェス対局全体、カラフルな動物フィギュアとのインタラクションなどがあります。
ロボット基盤モデルのためのデータピラミッド
実世界データは、抽象的な事前知識と具体的な物理行動を結びつける重要な「結合組織」です。トレーニングを最適化するために、LeRobot は Gr00t から着想を得たデータピラミッド構造を参照しています。データ量は、具現化の具体性が高まるにつれて減少します:
- Foundation: 大規模なウェブ・動画データ。
- Simulated Diversity: 合成データ。
- Physical Execution: 実世界ロボットインタラクション(最上位)。
実世界でのインタラクションの量と多様性を増やすことで、シミュレーションから実世界へのギャップが縮まり、ピラミッドのすべての層間の結びつきが構造的に強化され、より頑健で有能なポリシーが実現します。
コミュニティデータキュレーションの課題
コミュニティから提供されるデータ量が増加するにつれ、Hugging Face は現在のキュレーションパイプラインにおいて 4 つの主要課題を特定しました:
- タスク注釈の不整合: 多くのデータセットでタスク記述が空、極端に短い(例: "Up")または曖昧であり、認知システムが文脈を理解しにくくなっています。
- 特徴マッピングの不整合: カメラビューのラベリングが曖昧(例:
images.laptopを使用し、第三者視点か手首視点かが不明)です。 - 低品質エピソード: フレーム数が極端に少ないエピソードや、削除されたファイルが再インデックスされずに生じるシーケンスの破綻があります。
- 次元の不整合: 同一ロボットハードウェア(例: So100)を使用していても、アクションや状態の次元が揃っていないケースがあります。
高品質ロボティクスデータのベストプラクティス
コミュニティデータセットの有用性を高めるために、LeRobot はデータ収集の標準チェックリストを提供しています:
画像・動画の品質
- ビュー: 可能であれば 2 つのカメラビューを使用し、高解像度(最低 480x640 / 720p)で撮影します。
- 安定性: 手ブレのない安定した動画撮影を行い、ニュートラルで安定した照明を保ちます。
- 構図: リーダーアームがフレームに入らないようにし、フォロワーアームと操作対象のみが映るようにします。
- 背景: 静的で目立たない背景を使用します。
メタデータと命名規則
- FPS: 動画はおおよそ 30 フレーム/秒で記録します。
- 命名規則:
<modality>.<location>形式を使用します(例:images.top、images.wrist.left)。images.phoneのようなデバイス固有の名前は避けます。 - ロボット種別: メタデータで正しいロボット種別が選択されていることを確認し、LeRobot の config レジストリを参照して一貫性を保ちます。
タスク注釈
- 明確さ:
taskフィールドで目的を明確に記述します(例: "黄色のレゴブロックを拾って箱に入れる")。 - 長さ: 説明は概ね 25〜50 文字に収め、"task1" のような汎用ラベルは避けます。