amazon-far/fpo-control
Flow Policy Gradients for Robot Control
這是什麼?
FPO++ Code Release 是論文《Flow Policy Gradients for Robot Control》的官方程式碼。提供 Flow Policy Optimization (FPO++) 算法的可重現實驗,這是一種用於訓練機器人控制策略的強化學習方法。
主要元件
| 元件 | 目的 | 關鍵相依性 |
|---|---|---|
isaaclab_experiments/ |
在6+個機器人平台上的速度條件化行走實驗。包含訓練指令碼、預期學習曲線,以及執行任務所需的全部環境設定。 | Isaac Lab(模擬框架),rsl_rl(演員-評論家與在線策略執行者) |
manipulation_experiments/ |
在五個高階操作任務上的預訓練與微調。提供 FPO++、原始 FPO 與 DPPO 基線的指令碼。 | LeRobot(策略架構),robosuite(操作模擬器),DPPO(視覺 Transformer 編碼器),DexMimicGen(資料生成) |
如何開始
- 克隆倉儲(包含子模組):
git clone --recursive https://github.com/amazon-far/fpo-control.git cd fpo-control - 選擇一個實驗集並執行其設定指令碼:
# 行走(Isaac Lab) cd isaaclab_experiments bash setup_env.sh # 建立 conda 環境並安裝相依性 source source_env.sh # 操作 cd ../manipulation_experiments bash setup_env.sh source source_env.sh - 按照所選目錄內的 README 文件執行精確的訓練命令(例如
python train.py --config ...)。README 也列出預期的訓練曲線,讓您可驗證執行結果是否符合論文。
授權與第三方程式碼
此倉儲整合了多個外部專案,每個專案皆保留其原始授權:
- Isaac Lab (BSD-3) – 模擬核心與機器人資源。
- rsl_rl (BSD-3) – 為 FPO 適用的 RL 工具。
- LeRobot (Apache-2.0) – 策略網路定義。
- robosuite (MIT) – 操作環境。
- DPPO (MIT) – 視覺 Transformer 編碼器。
- DexMimicGen (NVIDIA Source Code License, 非營利) – 高階手部資料生成。 所有著作權宣告皆保留在修改後的檔案中。
誰在背後推動?
此工作是 Amazon FAR、UC Berkeley、Stanford、HKU 與 CMU 的合作成果。主要作者為 Brent Yi 與 Hongsuk Choi(同等貢獻),高階指導由 Pieter Abbeel、Guanya Shi、Karen Liu 與 Angjoo Kanazawa 擔任。
何時使用?
- 研究:重新實作或擴展 FPO++ 算法以應對新機器人任務。
- 基準測試:在行走或操作基準測試中,將 FPO++ 與原始 FPO 或 DPPO 進行比較。
- 教育:在真實機器人模擬器中學習完整的 RL 流程(環境、策略、訓練循環)。
快速重點
FPO++ Code Release 是一個真正的研究級軟體套件,讓您能在知名模擬與強化學習庫的基礎上,執行機器人行走與高階操作的最尖端強化學習實驗。
相關
- 專案
- 專案
- 專案
- 專案