amazon-far/abc

ABC: Scalable Behavior Cloning with Open Data, Training, and Evaluation

何を解決するか

ロボット工学における行動クラウンティングのスケーラブルなフレームワークを提供し、実世界およびシミュレーションデータの大量データセットから複雑な物理タスク(例:バケツ内のボトルを整理する)を学習できるようにします。

動作方法

本プロジェクトは、ABC-DiTを基盤とするトレーニングパイプラインを実装しています。ABC-DiTは、視覚バックボーン(DINOv3)とテキストエンコーダー(CLIP)を使用して視覚的・言語的入力を処理します。行動予測にはフローマッチングを採用し、シミュレーションデータと実世界データの混合でトレーニングが可能です。また、トレーニング中のデータ読み込みを最適化するため、Raw MCAPデータを専用フォーマット(バイナリ状態-行動ファイルおよび効率的なMP4ビデオスタック)に変換するツールも含まれています。

対象ユーザー

大規模な行動クラウンティングを用いて視覚-言語-行動(VLA)モデルをトレーニングし、シミュレーションおよび実世界環境で評価したいロボット工学の研究者およびエンジニア。

特徴

  • スケーラブルなトレーニング: 最適化されたスループットで、マルチGPU(例:8x H100/H200)でのトレーニングをサポート。
  • ハイブリッドデータ対応: シミュレーションデータと実世界データの両方でトレーニング可能で、汎化性能を向上。
  • 効率的なデータパイプライン: Rawロボットデータを高速トレーニングに適した高性能フォーマットに変換するスクリプトを提供。
  • 統合評価機能: Viserによる可視化を備えたシミュレーション評価スイートと、成功確率の体系的ログ記録を実装。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト