amazon-far/fpo-control

Flow Policy Gradients for Robot Control

這是什麼?

FPO++ Code Release 是論文《Flow Policy Gradients for Robot Control》的官方程式碼。提供 Flow Policy Optimization (FPO++) 算法的可重現實驗,這是一種用於訓練機器人控制策略的強化學習方法。


主要元件

元件 目的 關鍵相依性
isaaclab_experiments/ 在6+個機器人平台上的速度條件化行走實驗。包含訓練指令碼、預期學習曲線,以及執行任務所需的全部環境設定。 Isaac Lab(模擬框架),rsl_rl(演員-評論家與在線策略執行者)
manipulation_experiments/ 在五個高階操作任務上的預訓練與微調。提供 FPO++、原始 FPO 與 DPPO 基線的指令碼。 LeRobot(策略架構),robosuite(操作模擬器),DPPO(視覺 Transformer 編碼器),DexMimicGen(資料生成)

如何開始

  1. 克隆倉儲(包含子模組):
    git clone --recursive https://github.com/amazon-far/fpo-control.git
    cd fpo-control
    
  2. 選擇一個實驗集並執行其設定指令碼:
    # 行走(Isaac Lab)
    cd isaaclab_experiments
    bash setup_env.sh   # 建立 conda 環境並安裝相依性
    source source_env.sh
    
    # 操作
    cd ../manipulation_experiments
    bash setup_env.sh
    source source_env.sh
    
  3. 按照所選目錄內的 README 文件執行精確的訓練命令(例如 python train.py --config ...)。README 也列出預期的訓練曲線,讓您可驗證執行結果是否符合論文。

授權與第三方程式碼

此倉儲整合了多個外部專案,每個專案皆保留其原始授權:

  • Isaac Lab (BSD-3) – 模擬核心與機器人資源。
  • rsl_rl (BSD-3) – 為 FPO 適用的 RL 工具。
  • LeRobot (Apache-2.0) – 策略網路定義。
  • robosuite (MIT) – 操作環境。
  • DPPO (MIT) – 視覺 Transformer 編碼器。
  • DexMimicGen (NVIDIA Source Code License, 非營利) – 高階手部資料生成。 所有著作權宣告皆保留在修改後的檔案中。

誰在背後推動?

此工作是 Amazon FAR、UC Berkeley、Stanford、HKU 與 CMU 的合作成果。主要作者為 Brent Yi 與 Hongsuk Choi(同等貢獻),高階指導由 Pieter Abbeel、Guanya Shi、Karen Liu 與 Angjoo Kanazawa 擔任。


何時使用?

  • 研究:重新實作或擴展 FPO++ 算法以應對新機器人任務。
  • 基準測試:在行走或操作基準測試中,將 FPO++ 與原始 FPO 或 DPPO 進行比較。
  • 教育:在真實機器人模擬器中學習完整的 RL 流程(環境、策略、訓練循環)。

快速重點

FPO++ Code Release 是一個真正的研究級軟體套件,讓您能在知名模擬與強化學習庫的基礎上,執行機器人行走與高階操作的最尖端強化學習實驗。

相關

  • 專案
  • 專案
  • 專案
  • 專案