OpenAI 竞争性自我对弈研究

OpenAI 已经证明竞争性自我对弈使得模拟的 AI 智能体能够发现复杂的身体技能——例如擒抱、下潜、假动作、踢球、接球和潜水——而无需将这些行为明确编程到环境中。这种方法确保训练环境保持在 AI 改进的最佳难度水平,表明自我对弈将成为未来强大 AI 系统的基础组成部分。

通过简单目标产生的涌现行为

竞争压力与简单的奖励结构相结合,使智能体能够自举自身性能。在涉及模拟 3D 机器人进行基本游戏的实验中,OpenAI 使用近端策略优化(PPO)为每个智能体独立训练神经网络策略。

训练方法

智能体使用两阶段奖励系统进行训练:

  1. **密集奖励:**最初,智能体因基本探索行为(如站立和向前移动)获得奖励。
  2. **竞争奖励:**这些密集奖励逐渐衰减至零,使智能体的焦点转向主要目标——赢或输(例如,将对手推出相扑擂台或将球踢进网中)。

案例研究:相扑摔跤

在相扑摔跤任务中,OpenAI 利用基于先前工作的密集探索奖励来训练类人机器人行走,去除了速度项并增加了从擂台中心的负 L2 距离。一旦智能体探索了擂台,该奖励被衰减至零,迫使智能体优化竞争奖励:将对手推出擂台。

迁移学习与泛化

通过竞争性自我对弈训练的智能体表现出迁移学习,即他们可以将在一个环境中学习到的技能应用到新的、未见过的环境中。

在一个特定测试中,一个接受相扑摔跤训练的智能体被放置在受到“风”力扰动的环境中。尽管在训练过程中从未遇到风,但相扑智能体成功保持直立。相比之下,使用经典强化学习训练行走的智能体在受到相同力时立即倒下。

减轻自我对弈中的过拟合

OpenAI 识别出过拟合的风险,即智能体共同学习专门针对单一对手的策略,而不是发展出通用策略。为了防止智能体学习狭窄的、特定于对手的对策,OpenAI 实施了以下策略:

  • **多样化对手集合:**智能体同时面对多个不同的对手。
  • **策略历史:**智能体面对训练过程早期阶段的策略。

通过针对多样化策略集合进行训练,智能体被迫发展出对各种对手都有效的通用策略。

可用性

OpenAI 已通过 GitHub 将此研究中使用的 MuJoCo 环境和训练好的策略向公众发布,以便进一步实验自我对弈系统。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch