amazon-far/fpo-control
Flow Policy Gradients for Robot Control
这是什么?
FPO++ Code Release 是论文《Flow Policy Gradients for Robot Control》的官方代码。它提供了 Flow Policy Optimization (FPO++) 算法的可复现实验,这是一种用于训练机器人控制策略的强化学习方法。
主要组件
| 组件 | 目的 | 关键依赖 |
|---|---|---|
isaaclab_experiments/ |
在6+个机器人平台上进行速度条件化行走实验。包含训练脚本、预期学习曲线以及运行任务所需的所有环境设置。 | Isaac Lab(仿真框架),rsl_rl(演员-评论家和在线策略运行器) |
manipulation_experiments/ |
在五个精细操作任务上的预训练和微调。提供 FPO++、原始 FPO 和 DPPO 基线的脚本。 | LeRobot(策略架构),robosuite(操作仿真器),DPPO(视觉Transformer编码器),DexMimicGen(数据生成) |
如何开始
- 克隆仓库(包含子模块):
git clone --recursive https://github.com/amazon-far/fpo-control.git cd fpo-control - 选择一个实验集并运行其设置脚本:
# 行走(Isaac Lab) cd isaaclab_experiments bash setup_env.sh # 创建 conda 环境并安装依赖 source source_env.sh # 操作 cd ../manipulation_experiments bash setup_env.sh source source_env.sh - 按照所选目录中的 README 文件中的说明执行精确的训练命令(例如
python train.py --config ...)。README 还列出了预期的训练曲线,以便您验证运行结果是否与论文一致。
许可与第三方代码
该仓库捆绑了多个外部项目,每个项目均保留其原始许可证:
- Isaac Lab (BSD-3) – 仿真核心和机器人资产。
- rsl_rl (BSD-3) – 为 FPO 适配的 RL 工具。
- LeRobot (Apache-2.0) – 策略网络定义。
- robosuite (MIT) – 操作环境。
- DPPO (MIT) – 视觉Transformer编码器。
- DexMimicGen (NVIDIA Source Code License, 非商业) – 高度灵巧手的数据生成。 所有版权声明均保留在修改后的文件中。
谁在背后支持?
该工作是 Amazon FAR、UC Berkeley、Stanford、HKU 和 CMU 的合作成果。主要作者为 Brent Yi 和 Hongsuk Choi(同等贡献),高级指导由 Pieter Abbeel、Guanya Shi、Karen Liu 和 Angjoo Kanazawa 负责。
何时使用?
- 研究:重新实现或扩展 FPO++ 算法以应对新机器人任务。
- 基准测试:在行走或操作基准测试中,将 FPO++ 与原始 FPO 或 DPPO 进行比较。
- 教育:在真实的机器人仿真器中学习一个完整的 RL 流水线(环境、策略、训练循环)。
快速要点
FPO++ Code Release 是一个真正的研究级软件包,可让您在知名仿真和强化学习库的基础上,运行机器人行走和精细操作的最先进强化学习实验。
相关
- 项目
- 项目
- 项目
- 项目