OpenAI 研究请求 2.0

OpenAI 已发布研究请求 2.0,这是一套源自其内部研究的七个未解决问题。此举旨在通过提供强化学习(RL)、生成模型和自动推理领域的具体、高影响力技术挑战,吸引更广泛的研究社区参与。

强化学习挑战

OpenAI 确定了若干旨在提升强化学习智能体稳定性和效率的挑战。

多人游戏环境(Slitherin’)

研究人员的任务是将经典贪吃蛇游戏的多人版作为 Gym 环境实现。目标是使用自对弈和 RL 算法开发一个智能体来解决该环境。关键技术难点包括:

  • 环境设计:创建一个大型场景,其中多条蛇通过吃水果增长,并在碰到墙壁、其他蛇或自身时死亡。
  • 自对弈不稳定性:通过尝试针对过去策略分布进行训练来克服自对弈常伴随的不稳定性(类似 GAN 不稳定性)。
  • 行为分析:判断智能体是否学会了诸如攻击、陷阱或结队对付竞争对手等复杂策略。

分布式强化学习中的参数平均

此请求侧重于分布式 RL 算法的样本复杂度和通信开销。OpenAI 建议探索参数平均方案,通过独立更新工作节点并不频繁平均参数来降低通信带宽。潜在好处包括:

  • 探索改进:参数不同的智能体可能表现出更好的探索行为。
  • 样本复杂度:研究不同的平均方案(包括如 EASGD 等算法)如何影响整体学习效率。

生成模型与架构

OpenAI 提出研究基于 Transformer 的模型的效率和可迁移性。

通过生成模型进行迁移学习

此挑战探讨在多样化任务集上进行预训练是否能提升在新任务上的表现。所提出的方法包括:

  • 为 11 个 Atari 游戏训练策略。
  • 将生成模型(如 Transformer)拟合到这 10 个游戏的轨迹上。
  • 在第 11 个游戏上微调模型以量化预训练的好处。
  • 分析模型大小以及第 11 个游戏可用数据量如何影响迁移学习的收益。

具有线性注意力的 Transformer

OpenAI 寻求一种用线性注意力机制替换 Transformer 中的 softmax 注意力机制的方法。这将使 Transformer 能够转换为具有快速权重的 RNN,从而在大上下文上进行 RL rollout 成为可能。具体目标是使用线性注意力 Transformer 在语言建模任务上达到与原来相同的每字符/词比特数,而不对总参数量造成显著增加。OpenAI 指出这可能需要更高维度的 key/value 向量。

自动推理

OpenAI 向社区提出挑战,要求开发奥林匹克不等式问题的自动求解方案。这些问题表达起来简单,但求解需要巧妙的变换。目标是构建这些问题的数据集,并创建一个能够解决其中大部分问题的程序,可能使用学习到的策略在求解搜索过程中减少分支因子。

入门问题(热身)

为了帮助研究者入门,OpenAI 提供了两个已解决的入门问题:

  • LSTM XOR 问题:训练 LSTM 来判断二进制序列的奇偶性,以测试定长和变长二进制字符串之间的性能差异。
  • Snake Gym 环境:将基本的贪吃蛇游戏实现为 Gym 环境,并使用强化学习算法求解。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch