OpenAI RL²: 透過慢速強化學習實現快速強化學習

OpenAI 已宣布 RL²,這是一個框架,能讓代理透過將強化學習(RL)過程視為從數據中學習的模型,快速學習新任務。透過將 RL 演算法編碼到遞迴神經網路(RNN)的權重中,RL² 使代理能在僅需數次試驗中適應全新且之前未見過的馬可夫決策過程(MDP),模擬動物般利用先前知識學習的能力。

RL² 框架:學習如何學習

RL² 的設計目的是彌合深度強化學習(deep RL)對大量試驗的需求與動物利用先前知識快速學習新任務的能力之間的差距。核心概念是使用一個遞迴神經網路(RNN)來表示典型強化學習演算法所接收的相同資訊——觀測值、動作、獎勵和終止標誌——作為輸入。

系統在兩個層級上進行學習:

  • Slow RL: 使用通用的 RL 演算法來訓練 RNN 的權重。這個「慢」過程會在許多不同的環境(MDP)中發生,涉及網路自身的權重。

  • Fast RL: RNN 的激活值存儲了狀態的

Sources