Farama-Foundation/MO-Gymnasium

Multi-objective Gymnasium environments for reinforcement learning

解决的问题

提供一种标准化的方法,用于开发和比较多目标强化学习(MORL)算法。此前,研究人员需要一个一致的API以及能够同时处理多个奖励信号(而非单一标量值)的基准环境。

工作原理

MO-Gymnasium 扩展了标准的 Gymnasium API。虽然它保持了与环境交互的基本结构,但修改了奖励系统:step 函数不再返回单个数值,而是返回一个作为 numpy 数组的向量化奖励。它还包含一个 LinearReward 包装器,允许用户通过权重可选地将多个奖励转换回单个标量值。

适用人群

需要可靠工具包来在标准环境中对算法进行基准测试和验证的多目标强化学习研究人员和开发者。

主要亮点

  • 多目标强化学习的标准化 API。
  • 包含来自 MORL 文献的多种环境,以及 MuJoco 等经典环境的多目标版本。
  • 严格的环境版本控制,确保研究可复现性。
  • 与 Gymnasium API 模式兼容。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目