进化策略作为强化学习的可伸缩替代方案

OpenAI 发现,进化策略(ES)是一种历经数十年的优化技术,在 Atari 和 MuJoCo 等现代基准测试上,其表现与标准强化学习(RL)相当。通过消除对反向传播的需求、简化分布式扩展以及提升对稀疏奖励的鲁棒性,ES 克服了传统 RL 的若干不便。

进化策略 vs. 强化学习

进化策略(ES)作为一种黑箱随机优化技术发挥作用。与传统 RL 不同,后者通过在动作空间中注入噪声并使用反向传播来更新参数来优化策略,而 ES 则直接在参数空间中注入噪声。

ES 算法

ES 将策略网络视为一个黑箱,其中一组参数(权重)作为输入,单一的总奖励作为输出。优化过程遵循“猜测和检查”循环:

  1. 扰动:算法采取一个参数向量,通过添加高斯噪声生成一个略有不同的版本群体。
  2. 评估:每个候选者在环境中独立运行以计算总奖励。
  3. 更新:参数向量通过候选者的加权和进行更新,其中权重与所获得的奖励成比例。

此过程在数学上等价于通过在随机方向上的有限差分来估计参数空间中预期奖励的梯度。

ES 的技术优势

ES 相较于传统 RL 算法提供了若干运营优势:

  • 消除反向传播:因为 ES 只需要策略的前向传播,它不需要反向传播或价值函数估计。这使得代码在实践中快 2-3 倍,并允许使用不可微的策略,例如二进制网络或如路径查找这样的复杂模块。
  • 高度并行化:ES 工作器只需通信少量标量(奖励),而无需同步整个参数向量。通过控制随机种子,工作器可以在本地重构扰动。这使得在扩展到数千个 CPU 核心时能够实现线性加速。
  • 增强鲁棒性:ES 对经常导致 RL 失败的超参数不那么敏感。例如,ES 在 Atari 游戏的不同帧跳过设置下保持一致的性能,而 RL 则不是“无尺度的”。
  • 一致探索:通过使用确定性策略,ES 避免了策略梯度方法中常见的“随机抖动”,从而使环境探索更加一致。
  • 长期信用分配:当情节包含许多时间步、动作具有持久影响或缺乏可靠的价值函数估计时,ES 特别有效。

性能和可伸缩性基准测试

OpenAI 将 ES 与标准 RL 基准进行了比较,具体是 MuJoCo 控制任务和 Atari 游戏,重点在于数据效率和墙钟时间。

MuJoCo 控制任务

虽然 ES 的数据效率低于 TRPO(大约低 10 倍),但由于其可伸缩性,在墙钟时间方面要快得多。使用 80 台机器上的 1,440 个 CPU,ES 在 10 分钟内训练了一个 3D MuJoCo 人形行走者,而使用 32 个核心的 A3C 大约需要 10 小时。

Atari 游戏玩法

使用 720 个核心,ES 在 Atari 游戏上达到了与 A3C 相当的性能,将训练时间从一天(A3C 在 32 个核心上)缩短到仅一小时。

实际限制和范围

ES 并不是所有机器学习技术的通用替代方案。OpenAI 指出了两个主要限制:

  1. 参数敏感性:为了让 ES 生成梯度信号,对参数添加噪声必须导致不同的行为结果。OpenAI 发现虚拟批归一化有助于缓解这一点,但仍需要进一步研究网络参数化。

  2. 稀疏奖励挑战:在诸如 Montezuma’s Revenge 之类的环境中,需要特定的动作序列才能获得奖励(例如,找到钥匙),RL 中的随机动作偶尔可能成功,而 ES 中的随机参数噪声则可能不会。

关于监督学习的说明:ES 不适用于监督学习任务(例如,图像分类)。在 MNIST 数字识别任务上的测试表明,ES 可能比反向传播慢多达 1,000 倍,因为监督学习允许计算精确梯度,使得 ES 基于采样的方法效率低下。

Sources