OpenDriveLab/RISE

[RSS 2026] Code for RISE: Self-Improving Robot Policy with Compositional World Model

What it solves

RISE 解决了真实世界机器人交互所带来的高成本和繁琐的重置过程。它提供了一个框架,让机器人策略能够通过模拟经验(想象)自行改进,而不必完全依赖实体硬件交互。

How it works

RISE 使用由可控多视角动力学模型和进度值模型组成的组合式世界模型。此设置使系统能够生成想象的 rollout——模拟的动作和结果序列,并将其用于通过在线强化学习训练和启动机器人策略。

Who it’s for

从事机器人操作和强化学习的研究者与开发者,想在无需持续实体重置或昂贵硬件磨损的情况下扩大策略改进。

Highlights

  • Compositional World Model:结合动力学模型和进度值模型,为策略训练提供信息丰富的优势。
  • RL in Imagination:通过世界模型创建的模拟环境,在想象中训练策略,实现可扩展的自我改进。
  • Real-world Gains:在如砖块分类(+35%)、背包打包(+45%)和盒子关闭(+35%)等灵巧任务上展示了显著的性能提升。