nicklashansen/tdmpc2

Code for "TD-MPC2: Scalable, Robust World Models for Continuous Control"

解决的问题

TD-MPC2 旨在为连续控制任务创建鲁棒且可扩展的智能体。它解决了使用单套超参数在广泛环境(如机器人技术和物理模拟)中训练高性能智能体的挑战,减少了为每个任务进行繁琐调优的需求。

工作原理

TD-MPC2 是一种模型驱动的强化学习算法,它使用世界模型(world models)来预测未来的状态和奖励。它同时支持单任务在线强化学习(从经验中学习)和多任务离线强化学习(从预先收集的数据集中学习)。该系统可以处理基于状态和基于像素(RGB)的观测,并且可以扩展到拥有 3.17 亿个参数的模型,以处理跨不同领域和具身智能的数十个任务。

适用对象

本项目面向机器人技术、具身智能和强化学习领域的科研人员和开发人员,特别是那些专注于连续控制和多任务学习的人士。

亮点

  • 广泛的兼容性:支持 DMControl、Meta-World、ManiSkill2 和 MyoSuite 中的 104 个连续控制任务。
  • 可扩展性:能够训练单个智能体(高达 3.17 亿参数)来执行 80 个不同的任务。
  • 多功能性:同时适用于基于状态和基于像素的观测。
  • 鲁棒性:使用单套超参数即可在无模型(model-free)和基于模型(model-based)的方法中表现出竞争力。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目