OpenAI 学者计划 2021:最终项目

OpenAI 已发布 2021 年学者计划的最终项目,展示了一系列聚焦于规模定律、模型架构以及 AI 系统对齐的研究工作。该计划旨在为来自弱势群体的个人提供研究经验,使他们能够为深度学习前沿贡献力量。

规模定律与语言迁移

Christina Kim 的研究探讨了英语预训练在跨语言迁移学习中的有效性。研究发现,预训练的英语模型在学习德语时带来的收益最大,其次是西班牙语,最后是中文。此外,英语向这三种语言的迁移在计算、数据和参数方面呈现可预测的规模扩展规律。

奖励建模与反馈回路

研究 AI 模型如何与人类价值观和数据生态系统交互是多位学者的主要关注点:

  • 大规模奖励建模: Jonathan Ward 证明了奖励模型(通常基于人类反馈进行训练)可以使用从网站提取的大规模结构化反馈进行训练。
  • 观点建模: Danielle Ensign 调查了深度学习模型对观点生态系统的影响以及对先前模型输出进行迭代训练的效果(反馈回路)。

模型架构与表征学习

多个项目聚焦于不同 AI 架构的技术约束和性能表现:

  • 对比学习: Ellie Kitanidis 使用纯对比目标对语言表征模型进行预训练,以研究其相较于传统语言建模目标的通用性和可扩展性。Legg Yeung 使用 “SET” 纸牌游戏探讨向量表征维度与任务组合之间的关系,发现参数为 X 的非对比模型能够解决参数为 2X+ 的对比模型无法完成的游戏。
  • Transformer 变体: Shola Oyedele 研究了不同 Transformer 架构变体的规模定律,以了解架构对训练成本与模型性能之间权衡的影响。
  • 分词: Sam Gbafa 探索了不同语言分词方案的权衡与规模化,包括一种学习序列切分而非使用预定义切分的方法。

强化学习与计算效率

控制与计算领域的项目探讨了如何对复杂行为建模以及如何优化资源使用:

  • 连续控制: Florentine (Tyna) Eloundou 开发了 “多专家、多目标”(MEMO)方法。该方法允许智能体从多个具有不同目标的专家成功示例中学习单一条件策略,监督者随后可以自行决定如何引导该策略。
  • 测试时计算: Kudzo Ahegbebu 探索了利用测试时计算的模型在自回归 Transformer、深度平衡模型和图神经网络中的通用性。研究调查了小型自适应模型是否能够通过测试时计算克服可学习参数数量较少的限制。

学者对深度学习研究的见解

2021 年学者们为进入 AI 研究领域的人提供了若干关键建议:

"我对刚开始深度学习研究的人建议是,花时间理解基础论文的洞见,并记住这个领域仍相对新颖。个人有很大的空间产生超出预期的影响。"

"如果可能的话,花几个月仔细学习 2019 年 fast.ai 课程(第 1 部分和第 2 部分)、Andrew Ng 在 Coursera 上的深度学习课程、David Silver 的强化学习课程,以及 Spinning Up in Deep RL……尝试用 pytorch 从头实现几篇论文。"

"找到你能想到的最简单有趣的想法并实现它!"

"我建议在阅读理论基础的同时,慢慢逐步阅读知名算法的干净开源实现。"

Sources