OpenAI 一次性模仿学习

OpenAI 已经开发出一种用于一次性模仿学习的元学习框架,使机器人能够从单次演示中学习任务,并立即泛化到该任务的新实例。这种方法消除了传统模仿学习通常所需的大量特征工程或大样本量的需求。

元学习框架以实现泛化

一次性模仿学习利用元学习方法来学习如何学习。与其孤立地解决特定任务,不如在一个大型任务集合上训练模型,每个任务具有多个实例。例如,一个任务可能涉及将积木堆叠成单塔或将积木排列成两块塔。每个任务实例涉及不同的初始状态和不同的积木集合。

训练过程

在训练过程中,算法会得到演示对。神经网络被训练以接受两个输入:一个演示和机器人的当前状态。在此过程中,模型尝试匹配配对中第二个演示的状态和动作序列。目标是输出一个动作,使得状态和动作序列尽可能接近第二个演示。

测试时性能

在测试时,模型会得到一个新任务单个实例的演示。然后神经网络被期望在该新任务的新未见实例上执行该任务。此能力使机器人能够基于运行时提供的单独演示来执行其从未见过的新任务。

技术实现和可扩展性

该系统采用软注意力机制,使模型能够泛化到训练数据中未出现的条件和任务。这使得模型能够适用于更广泛的任务和设置。

OpenAI 研究人员预期,通过在更多种类的任务和设置上训练模型,模型最终将成为一个通用系统,能够将任何演示转化为能够完成各种任务的稳健策略。

summary: OpenAI 提出了一种用于一次性模仿学习的元学习框架,使机器人能够从单次演示中学习新任务,并在无需特定任务工程的情况下泛化到新情境。

title: OpenAI 一次性模仿学习

Sources