OpenGalaxea/GalaxeaVLA

Galaxea's open-source VLA repository

何を解決するか

GalaxeaVLAは、視覚認識、自然言語指示、正確なモーター動作を組み合わせることで、複雑な操作タスクを実行できる汎用ロボット制御システムを提供します。このモデルは、高レベルの推論(何をすべきかを理解する)と低レベルの実行(ロボットアームをどう動かすか)の間のギャップを1つのモデル内で橋渡しする課題に対処します。

仕組み

コアとなるのはG0.5という自己回帰型視覚言語行動(VLA)モデルです。従来のシステムがVLMを別個のエンコーダとして使用するのとは異なり、G0.5は1つのトランスフォーマー・デコーダを使って、推論トークンと行動トークンを連続したストリームで生成します。

主な技術的要素は以下の通りです:

  • 統合ストリーム:マルチビューRGB画像、ロボット状態、テキスト指示を処理し、まず体現された推論(サブタスクやオブジェクトの位置特定など)を含むシーケンスを出力し、その後に構造化された行動トークンを出力します。
  • クロス体現型ActionCodec:多様なロボット動作を共有の27次元行動空間にマッピングする学習済みトークナイザーであり、異なるロボットハードウェア間での一般化を可能にします。
  • ネイティブなChain-of-Thought:推論がトークン列に直接統合されており、モデルは実際に移動命令を出力する前にタスクについて「考える」(例:オブジェクトのバウンディングボックスを特定する)ことができます。
  • 視覚メモリ:因子化された空間時間アテンションを使用して、数秒分の視覚履歴を組み込み、安定性と文脈認識を向上させます。

対象ユーザー

本プロジェクトは、体現AIに取り組むロボット研究者および開発者を対象としており、特にR1 Lite、R1 Pro、SO-100/101、Frankaなどの実世界ロボットにモデルをデプロイする場合や、LIBEROやRoboTwinなどのシミュレータでテストを行う場合に適しています。

特徴

  • 単一ストリームアーキテクチャ:推論と行動を1つの次トークン予測目的に統合します。
  • 広範なハードウェア対応:複数の実世界ロボットエミュレーション用のデプロイエントリポイントを含みます。
  • 高いパフォーマンス:DROID(82.5%)やLIBERO(98.9%)などのベンチマークで強力なゼロショット成功率を示します。
  • オープンワールドデータセット:RLDSおよびLeRobot形式で、500時間以上の実世界モバイル操作データを提供します。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト