Open-X-Humanoid/HEX

HEX is a whole-body vision-language-action framework for full-sized humanoid robots.

解決する課題

HEXは、異なるハードウェアプラットフォームにわたるフルサイズのヒューマノイドロボットの全身操作の課題に対処します。異種データソースから学習し、異なるヒューマノイドの形態(embodiments)間でポリシーを転送することで、ロボットが長期的な操作タスクを実行できるようにします。

仕組み

HEXは、視覚的および言語的な理解にQwen-VLバックボーンを使用するビジョン・言語・アクション(VLA)フレームワークです。統一プロプリオセプション予測器(UPP)を採用して、異なるヒューマノイドの状態を共有された身体部位のスロットに整列させ、モデルが多様なデータセットから予測的な身体ダイナミクスを学習できるようにします。フローマッチングアクションヘッドは、腕、手、腰の連続的な将来の動作を予測します。安定性のために、HEXは、脚の動作を処理する低レベルのRLベースの全身コントローラーに高レベルのコマンドを提供します。

対象者

このプロジェクトは、ヒューマノイドロボットの制御、クロスエンボディメント学習、およびビジョン・言語・アクションモデルに取り組んでいるロボット工学の研究者および開発者向けです。

ハイライト

  • クロスエンボディメント能力: 異種ヒューマノイドの状態を整列させ、異なるプラットフォーム(例:Unitree G1, H1, Leju Kuavo)間でのポリシー転送を可能にします。
  • 全身協調: 上半身と腰のハイレベルなVLA予測と、脚の安定性のための低レベルRLコントローラーを組み合わせます。
  • 包括的なデータサポート: さまざまなヒューマノイドプラットフォームのデータセットのための、事前学習およびファインチューニングのコードが含まれています。
  • シミュレーションサポート: LIBEROのようなシミュレーション環境で評価およびトレーニングが可能です。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト