OpenAI 基于动作依赖因子化基线的策略梯度方差降低
OpenAI 引入了一种使用动作依赖因子化基线的策略梯度方法的方差降低技术。该方法降低了梯度估计的高方差,这在深度强化学习中是一个关键瓶颈,尤其是对于具有长时间跨度或高维动作空间的问题。
动作依赖基线用于方差降低
策略梯度方法常常受到梯度估计高方差的困扰,这可能导致学习不稳定和收敛缓慢。为了解决此问题,OpenAI 的研究人员推导出一种无偏的动作依赖基线,利用随机策略本身的结构形式。
与传统的状态依赖基线不同,该方法不对马尔可夫决策过程(MDP)作额外假设,且保持无偏。研究人员展示了动作依赖基线能够超越最优的状态依赖基线,而后者在高维控制问题中表现次优。
高维控制中的性能
所提出的动作依赖基线方法计算效率高,并能有效扩展到高维控制问题。研究人员通过一个合成的 2000 维目标匹配任务验证了这种效率,算法成功地扩展到如此高的维度。
在标准强化学习基准、高维手部操作任务以及合成任务上的实验结果表明,使用动作依赖基线时,智能体的学习速度更快。
对部分可观测和多智能体任务的扩展
将额外信息纳入基线以提升方差降低的通用原则可以超出标准 MDP 的范围。研究人员展示了该方法可应用于部分可观测任务和多智能体强化学习环境,从而在复杂情境中进一步提升稳定性。
技术贡献概述
- 无偏方差降低:一种利用策略结构形式的新基线推导,可在不引入偏差的情况下降低梯度方差。
- 可扩展性:在合成任务中展示了在高维动作空间(最高 2000 维)中的有效性。
- 学习速度:在标准强化学习基准和复杂手部操作任务上实现更快的收敛。
- 通用性:可扩展至部分可观测和多智能体强化学习场景。
SUMMARY: OpenAI 的研究人员开发了一种无偏的动作依赖基线用于策略梯度方法,以降低梯度估计的方差,从而在高维动作空间中实现更快的学习。
TITLE: OpenAI 基于动作依赖因子化基线的策略梯度方差降低