dexmal/dexbotic

Dexbotic: Open-Source Vision-Language-Action Toolbox

何を解決するか

Dexboticは、身体的な知能のための視覚言語行動(VLA)モデルを開発する際の複雑さに対処します。統合されたツールボックスを提供し、VLA開発のライフサイクル全体——事前学習、ファインチューニング、推論、評価——を簡素化します。これにより、異なるロボットポリシーを扱う際の断片的な設定の必要性が削減されます。

仕組み

PyTorchに基づき、レイヤード構成、ファクトリーレジストリ、エントリディスパッチを活用したモジュールアーキテクチャで構成されています。これにより、研究者はモデルの交換、タスク設定の変更、または実験スクリプトによる新機能の追加が、コアロジックの再実装なしで可能になります。さまざまなロボット向けの統一されたトレーニングデータフォーマットをサポートし、主流のアルゴリズム向けに最適化された事前学習済みの基礎モデルを提供します。このシステムは、ローカルのコンシューマーGPUからクラウドプラットフォームまで対応しており、Blackwell GPUのような高性能ハードウェアにも特別なサポートを提供しています。

対象ユーザー

身体的な知能の分野でVLAモデルを構築または評価している研究者や開発者向けです。特にロボット操作およびナビゲーションに焦点を当てています。

主な特徴

  • 広範なモデル対応: π0、CogACT、OFT、MemVLA、DM0 などの主流VLAポリシーを統合しています。
  • ロボット互換性: UR5、Franka、ALOHA などのロボット向けに統一されたデータフォーマットとデプロイスクリプトを提供します。
  • 柔軟なトレーニング: ローカルおよびクラウドトレーニングをサポートしており、FSDP2による分散トレーニングやGRPOによる強化学習も対応しています。
  • 最適化された推論: 統一されたv1推論APIとTritonバックエンドのリアルタイムバックエンドにより、大幅な高速化を実現しています。
  • 包括的なベンチマーク: Libero、CALVIN、SimplerEnv、ManiSkill2、RoboTwin2.0 などの環境向けに、すぐに使える評価パイプラインを提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch