OpenDriveLab/RISE
[RSS 2026] Code for RISE: Self-Improving Robot Policy with Compositional World Model
What it solves
RISE 解决了真实世界机器人交互所带来的高成本和繁琐的重置过程。它提供了一个框架,让机器人策略能够通过模拟经验(想象)自行改进,而不必完全依赖实体硬件交互。
How it works
RISE 使用由可控多视角动力学模型和进度值模型组成的组合式世界模型。此设置使系统能够生成想象的 rollout——模拟的动作和结果序列,并将其用于通过在线强化学习训练和启动机器人策略。
Who it’s for
从事机器人操作和强化学习的研究者与开发者,想在无需持续实体重置或昂贵硬件磨损的情况下扩大策略改进。
Highlights
- Compositional World Model:结合动力学模型和进度值模型,为策略训练提供信息丰富的优势。
- RL in Imagination:通过世界模型创建的模拟环境,在想象中训练策略,实现可扩展的自我改进。
- Real-world Gains:在如砖块分类(+35%)、背包打包(+45%)和盒子关闭(+35%)等灵巧任务上展示了显著的性能提升。