OpenAI RL²: 遅い強化学習を介した高速強化学習

OpenAIは、データから学習されるモデルとして強化学習(RL)プロセスを扱うことで、エージェントが新しいタスクを素早く学習できるようにするフレームワークRL²を発表しました。RNN(リカレントニューラルネットワーク)の重みにRLアルゴリズムをエンコードすることにより、RL²はエージェントが未見のマルコフ決定プロセス(MDP)に適応することをわずか数回の試行で可能にし、過去の知識から学ぶ動物のような能力を模倣します。

RL²フレームワーク: 学習する学習

RL²は、ディープRLが膨大な試行回数を必要とすることと、動物が過去の知識を活用して新しいタスクを素早く学習できる能力の間のギャップを埋めるように設計されています。コアコンセプトは、典型的なRLアルゴリズムが受け取る同じ情報—観測、行動、報酬は、および終了フラグ—を表すRNNにすることです。入力として。

システムは2つのレベルの学習で動作します:

  • 遅いRL: 汎用のRLアルゴリズムがRNNの重みを訓練するために使用されます。この「遅い」プロセスは、多様な環境(MDPs)にわたって行われ、ネットワークの自身の重みにわたって行われます。
  • 高速RL: RNNの活性化は、状態の

Sources