OpenAI 第三人称模仿学习
OpenAI 已经开发了一种无监督第三人称模仿学习的方法,使得 AI 智能体能够通过观察不同视角的示范来实现目标。这种方法消除了对第一人称示范的需求,在这种需求下,智能体必须被提供确切的状态和动作序列才能执行,从而简化了数据收集过程。
无监督第三人称模仿学习
第三人称模仿学习的核心目标是在观察老师从不同视角实现相同目标之后,训练智能体在简单环境中实现该目标。该过程被定义为“无监督”,因为智能体没有被提供老师状态与其自身状态之间的直接对应关系。
此方法解决了传统强化学习(RL)的一个主要限制。虽然 RL 使智能体能够实现复杂目标,但指定一个准确的奖励函数往往很困难。传统模仿学习通过使用第一人称示范来解决这个问题,但收集此类数据具有挑战性。通过模仿人类的学习方式——观察他人并推断任务——此方法使智能体能够从外部观察中学习。
技术方法:领域无关特征
此方法背后的主要技术洞察是应用域混淆来创建领域无关特征。这些特征在训练过程中至关重要,因为它们使智能体能够弥合老师视角与其自身视角之间的差距,确保所学行为无论从哪个视角观察示范都适用。
实验验证
OpenAI 在三个特定领域上验证了无监督第三人称模仿学习方法,以展示其有效性:
- Pointmass 域:测试智能体在简单基于点的环境中导航的能力。
- Reacher 域:测试智能体到达目标位置的能力。
- 倒立摆:测试智能体使摆锤保持直立位置的能力。
Sources
- OriginalThird-person imitation learning