OpenAI 迭代放大用于复杂目标学习

OpenAI 引入了迭代放大,这是一种旨在指定超出人类规模的复杂行为和目标的 AI 安全技术。该方法通过展示如何将复杂任务分解为更简单、可管理的子任务,使 AI 系统能够在人类无法直接执行或评判的任务上进行训练。

复杂任务的训练信号挑战

机器学习需要训练信号——例如监督学习中的标签或强化学习中的奖励——来评估性能并促进学习。虽然某些任务拥有算法化的训练信号(例如围棋比赛的计分)或可以由人类评判,但许多现实任务对人类的执行或判断而言过于复杂。例子包括管理大型计算机网络的安全或设计复杂的交通系统。

如果缺乏准确的训练信号,AI 系统无法学习任务,甚至可能因错误的奖励函数而产生意外且危险的行为。

迭代放大工作原理

迭代放大基于两个主要假设为复杂任务生成训练信号:第一,假设人类能够识别构成更大任务的较小组成部分;第二,假设人类能够完成该任务的极小实例。

该过程遵循一个迭代循环:

  1. 初始训练:系统抽样小的子任务,并使用能够解决这些小规模问题的人类示例进行训练。
  2. 任务扩展:系统抽样稍大一些的任务。人类通过将这些任务分解为 AI(在上一步已训练)已经能够解决的更小部分来帮助完成。
  3. 直接学习:通过人类辅助分解获得的这些更难任务的解答被用作训练信号,以训练 AI 在无需人类干预的情况下直接解决这些二级任务。
  4. 迭代:重复此过程,迭代地为日益复合的任务构建训练信号。

如果成功,这将产生一个完全自动化的系统,能够在没有初始直接训练信号的情况下解决高度复合的任务。

玩具领域的实验结果

由于在原型阶段处理超出人类规模的任务和真实的人类信号非常复杂,OpenAI 在五个玩具算法领域使用监督学习测试了迭代放大。在这些实验中,研究人员假装不知道直接的算法解答,模拟了人类能够组合解决方案的子部分但无法提供直接训练信号的情境。

测试的五个任务是:

  • 置换幂运算
  • 顺序分配
  • 通配符搜索
  • 最短路径
  • 并查集

在所有五种情况下,迭代放大的表现与直接监督学习相竞争,尽管放大过程未直接获取真实标签,但其性能仍匹配能够访问真实标签的系统。

与其他 AI 安全方法的关系

迭代放大与其他 OpenAI 安全研究在概念目标上相似,但在实现上有所不同:

  • 通过辩论实现 AI 安全:两者都试图通过迭代过程和间接监督来训练超出人类能力的任务,但采用了不同的具体方法。
  • 人类反馈:迭代放大实现了奖励预测系统,预计在未来版本中会加入直接的人类反馈。
  • 专家迭代:虽然类似于 AlphaGo Zero 使用的方法,但专家迭代是强化已有的训练信号,而迭代放大则是从零开始构建训练信号。

Sources