OpenAI 多目标强化学习机器人环境
OpenAI 已推出一套具有挑战性的连续控制任务,旨在推进多目标强化学习(RL)领域。这些环境已与 OpenAI Gym 集成,为基于额外输入指令学习实现各种目标的智能体提供了标准化的测试框架。
机器人环境与硬件
新套件环境侧重于基于现有机器人硬件的连续控制任务。这些任务按照其模拟的硬件进行分类:
- Fetch 机械臂: 任务包括推动、滑动和拾取放置操作。
- Shadow 灵巧手: 任务专注于手内物体操作。
多目标 RL 框架
这些环境采用多目标强化学习框架。在此设置中,智能体会获得一个额外输入,以指定其旨在实现的目标。这与单目标 RL 不同,后者中智能体学习特定任务。
为了保持严格的测试基准,此套件中的所有任务都具有稀疏二元奖励,即智能体仅在目标成功实现时获得奖励,而不是受密集奖励函数的引导。
研究目标与后经验重放
在这些环境发布之后,OpenAI 的技术报告提出了改进 RL 算法的具体研究方向。此研究请求的主要焦点是改进多目标 RL 和后经验重放(HER)。
HER 是一种技术,通过将达到的状态视为虚拟目标来帮助智能体从失败中学习,从而使智能体能够从每条轨迹中提取学习信号,即使这些轨迹未能实现原始预期目标。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch