dexmal/opendm

An Open-World Foundation Model for General-Purpose Embodied Intelligence.

何を解決するか

OpenDMは、オープンワールドロボット制御のためのフレームワークと事前学習モデルを提供します。ロボットが開かれた指示に従い、長時間のタスクを処理し、動的な擾乱に対応し、異なるロボットの体躯(マルチエムボディメント)で動作できるようにする課題に対処します。

仕組み

このプロジェクトの中心は、DM0.5と呼ばれるビジョン・言語・アクション(VLA)モデルです。視覚入力(ヘッドカメラやワリスカメラからのものなど)と言語指示を処理し、ロボットの行動を予測します。システムは、教師あり微調整(SFT)とLoRA学習をサポートしており、ベースモデルを特定のロボットハードウェアやタスクに適応できます。また、TensorRT、Triton、PyTorch FlexAttentionを用いた「高速バックエンド」も含まれており、推論を高速化しています。

対象ユーザー

実世界またはシミュレートされたロボット制御のためのVLAモデルの学習、微調整、デプロイが必要な、エムボディドAIおよびロボティクス分野の研究者や開発者。

主な特徴

  • マルチエムボディメント対応:AgileX COBOT MagicやDOS-W1など、さまざまなロボットプラットフォームに対応。
  • VLAアーキテクチャ:視覚、言語、行動予測を1つのモデルに統合。
  • 柔軟な学習:フルSFTおよびLoRA微調整ワークフローをサポート。
  • 高性能推論:ロボット制御における遅延低減を目的とした専用高速バックエンドを提供。
  • ベンチマーク対応:LIBERO、RoboTwin2.0、VLA-Arenaなどのベンチマーク用に事前学習済みチェックポイントと評価ワークフローを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト