Lei-Kun/RL-100

[Science Robotics 2026] Official Implementation of the paper RL-100

解决的问题

RL-100 提供了一个统一的框架,用于改进机器人操作策略。它通过提供一种可重复的后训练策略强化学习(RL)流水线,弥合了初始模仿学习(行为克隆)与高性能、可靠的实际部署之间的差距。

工作原理

该系统实现了一个多阶段流水线,从静态数据逐步过渡到主动交互:

  1. 行为克隆:从人类示范数据初始化策略。
  2. 离线强化学习:使用记录的轨迹通过策略梯度更新来优化策略。
  3. 在线强化学习:通过真实世界或模拟环境中的交互进一步微调策略。
  4. 一步蒸馏:将多步扩散或流模型策略转换为高效的单步策略(如 Diffusion-to-CM),以实现快速真实机器人推理。
  5. 数据飞轮:一个迭代循环,将离线训练的策略部署以收集新的机器人轨迹,然后将这些新数据合并回训练数据集中,以进一步提升下一轮离线强化学习的性能。

适用对象

专为从事视觉运动策略的机器人研究人员和工程师设计,为他们提供从远程操作数据到稳健、可部署机器人控制的标准化路径。

主要亮点

  • 灵活的策略骨干:支持扩散模型和流模型策略。
  • 多模态观测:兼容 3D 点云和 2D RGB 图像。
  • 多功能控制:支持动作分块和高频单动作控制。
  • 集成数据工具:包含远程操作数据采集和迭代式 Zarr 数据集管理的实用工具。

相关

  • 项目
  • 项目
  • 项目
  • 项目