amazon-far/fpo-control

Flow Policy Gradients for Robot Control

这是什么?

FPO++ Code Release 是论文《Flow Policy Gradients for Robot Control》的官方代码。它提供了 Flow Policy Optimization (FPO++) 算法的可复现实验,这是一种用于训练机器人控制策略的强化学习方法。


主要组件

组件 目的 关键依赖
isaaclab_experiments/ 在6+个机器人平台上进行速度条件化行走实验。包含训练脚本、预期学习曲线以及运行任务所需的所有环境设置。 Isaac Lab(仿真框架),rsl_rl(演员-评论家和在线策略运行器)
manipulation_experiments/ 在五个精细操作任务上的预训练和微调。提供 FPO++、原始 FPO 和 DPPO 基线的脚本。 LeRobot(策略架构),robosuite(操作仿真器),DPPO(视觉Transformer编码器),DexMimicGen(数据生成)

如何开始

  1. 克隆仓库(包含子模块):
    git clone --recursive https://github.com/amazon-far/fpo-control.git
    cd fpo-control
    
  2. 选择一个实验集并运行其设置脚本:
    # 行走(Isaac Lab)
    cd isaaclab_experiments
    bash setup_env.sh   # 创建 conda 环境并安装依赖
    source source_env.sh
    
    # 操作
    cd ../manipulation_experiments
    bash setup_env.sh
    source source_env.sh
    
  3. 按照所选目录中的 README 文件中的说明执行精确的训练命令(例如 python train.py --config ...)。README 还列出了预期的训练曲线,以便您验证运行结果是否与论文一致。

许可与第三方代码

该仓库捆绑了多个外部项目,每个项目均保留其原始许可证:

  • Isaac Lab (BSD-3) – 仿真核心和机器人资产。
  • rsl_rl (BSD-3) – 为 FPO 适配的 RL 工具。
  • LeRobot (Apache-2.0) – 策略网络定义。
  • robosuite (MIT) – 操作环境。
  • DPPO (MIT) – 视觉Transformer编码器。
  • DexMimicGen (NVIDIA Source Code License, 非商业) – 高度灵巧手的数据生成。 所有版权声明均保留在修改后的文件中。

谁在背后支持?

该工作是 Amazon FAR、UC Berkeley、Stanford、HKU 和 CMU 的合作成果。主要作者为 Brent Yi 和 Hongsuk Choi(同等贡献),高级指导由 Pieter Abbeel、Guanya Shi、Karen Liu 和 Angjoo Kanazawa 负责。


何时使用?

  • 研究:重新实现或扩展 FPO++ 算法以应对新机器人任务。
  • 基准测试:在行走或操作基准测试中,将 FPO++ 与原始 FPO 或 DPPO 进行比较。
  • 教育:在真实的机器人仿真器中学习一个完整的 RL 流水线(环境、策略、训练循环)。

快速要点

FPO++ Code Release 是一个真正的研究级软件包,可让您在知名仿真和强化学习库的基础上,运行机器人行走和精细操作的最先进强化学习实验。

相关

  • 项目
  • 项目
  • 项目
  • 项目