OpenAI 关于深度强化学习的基于计数的探索研究
OpenAI 关于深度强化学习的基于计数的探索研究 OpenAI 研究人员表明,经典基于计数的探索的简单推广——使用哈希码将高维状态映射到计数——可以在深度强化学习中达到接近最先进的性能。
OpenAI 关于深度强化学习的基于计数的探索研究
TL;DR
OpenAI 提出了一种经典基于计数探索的简单推广,该方法使用哈希码将高维状态映射到哈希表。这种方法使得基于计数的方法能够扩展到高维和连续状态空间,在 Atari 2600 游戏和连续控制任务上实现了接近最先进的性能。
将基于计数的探索扩展到高维空间
传统的基于计数的探索算法在使用表格强化学习的小型离散马尔可夫决策过程(MDP)中表现近乎最优。然而,由于大多数状态不太可能出现多次,使得简单计数变得不可能,因此它们历史上被认为不适用于高维或连续状态空间。
为了克服这一挑战,OpenAI 研究人员发现,将状态映射到哈希码可以实现状态出现次数的高效计数。通过使用哈希表来跟踪这些计数,智能体可以根据经典基于计数的探索理论计算奖励奖金,从而对访问自身新发现的状态提供奖励。
性能和基准测试
提出的基于哈希的计数方法在各种深度 RL 基准测试中实现了接近最先进的性能,包括:
- Atari 2600 游戏:该方法为解决需要显著探索的 MDP 提供了一个强大的基线。
- 连续控制任务:该方法能够有效地扩展到高维连续状态空间。
这种方法作为一个既简单又强大的基线,用于与更复杂的启发式方法进行比较,例如那些依赖于内在动机或在不确定性面前的乐观主义的方法。
有效哈希的关键因素
详细分析表明,用于探索的哈希函数的有效性至关重要。一个成功的哈希函数必须具备两个主要特征:
适当的粒度:该函数必须将足够相似的状态映射到相同的哈希码,从而有效地将相似状态分组。
相关信息编码:该函数必须编码与解决特定 MDP 相关的信息。
研究人员发现,虽然简单的哈希函数可以取得令人惊讶的好结果,但依赖于领域的学习哈希码可以进一步提升性能。