amazon-far/fpo-control

Flow Policy Gradients for Robot Control

これは何ですか?

FPO++ Code Release は、Flow Policy Gradients for Robot Control という論文の公式コードです。Flow Policy Optimization (FPO++) アルゴリズムの再現可能な実験を提供しており、ロボット制御ポリシーを学習するための強化学習手法です。


主な構成要素

コンポーネント 目的 主な依存関係
isaaclab_experiments/ 6種類以上のロボットプラットフォームでの速度条件付き歩行実験。トレーニングスクリプト、期待される学習曲線、タスク実行に必要な環境設定をすべて含みます。 Isaac Lab(シミュレーションフレームワーク)、rsl_rl(アクトル・クリティックおよびオンポリシー実行者)
manipulation_experiments/ 5つの高度な操作タスクにおける事前学習とファインチューニング。FPO++、バニラFPO、DPPOベースライン用のスクリプトを提供します。 LeRobot(ポリシーアーキテクチャ)、robosuite(操作シミュレータ)、DPPO(Vision Transformerエンコーダ)、DexMimicGen(データ生成)

使い方

  1. リポジトリをクローン(サブモジュール含む):
    git clone --recursive https://github.com/amazon-far/fpo-control.git
    cd fpo-control
    
  2. 実験セットを選択し、セットアップスクリプトを実行:
    # 歩行(Isaac Lab)
    cd isaaclab_experiments
    bash setup_env.sh   # conda環境を作成し、依存関係をインストール
    source source_env.sh
    
    # 操作
    cd ../manipulation_experiments
    bash setup_env.sh
    source source_env.sh
    
  3. 選択したディレクトリ内のREADMEに従って、正確なトレーニングコマンド(例: python train.py --config ...)を実行してください。READMEには期待される学習曲線も記載されており、実行結果が論文と一致するか確認できます。

ライセンスとサードパーティコード

このリポジトリには複数の外部プロジェクトがバンドルされており、それぞれ元のライセンスの下で維持されています:

  • Isaac Lab (BSD-3) – シミュレーションコアとロボットアセット。
  • rsl_rl (BSD-3) – FPO用に適応されたRLユーティリティ。
  • LeRobot (Apache-2.0) – ポリシーネットワーク定義。
  • robosuite (MIT) – 操作環境。
  • DPPO (MIT) – Vision Transformerエンコーダ。
  • DexMimicGen (NVIDIA Source Code License, 非営利) – 高度なハンドのデータ生成。 すべての著作権表示は、変更されたファイルに保持されています。

誰が開発していますか?

この研究はAmazon FAR、UC Berkeley、Stanford、HKU、CMUとの共同作業です。主著者はBrent YiとHongsuk Choi(同等貢献)、上級指導はPieter Abbeel、Guanya Shi、Karen Liu、Angjoo Kanazawaが担当しています。


いつ使うべきですか?

  • 研究:FPO++アルゴリズムを新しいロボットタスクに再実装または拡張する。
  • ベンチマーク:FPO++をバニラFPOやDPPOと比較して、歩行または操作ベンチマークで評価する。
  • 教育:現実的なロボットシミュレータ内で、環境、ポリシー、トレーニングループを含む完全なRLパイプラインを学ぶ。

一言で言うと

FPO++ Code Releaseは、有名なシミュレーションおよびRLライブラリを基盤にした、ロボット歩行および高度な操作の最先端強化学習実験を実行できる本格的な研究用ソフトウェアパッケージです。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト