隨機神經網路用於階層強化學習

OpenAI 已提出一個通用框架用於階層強化學習(HRL),該框架利用隨機神經網路來預訓練多樣化的技能集合,然後利用這些技能來加速下游任務的學習。此方法專門解決稀疏獎勵和長時程任務的挑戰,在這些情境下,傳統的深度強化學習常常難以有效探索。

透過隨機神經網路進行技能預訓練

該框架的核心是一個預訓練階段,在此階段中,代理在預訓練環境中學習有用的技能。為了高效地學習廣泛的可解釋技能,研究者結合使用隨機神經網路和資訊論正則化器。

此預訓練過程由單一代理獎勵引導,該獎勵僅需少量關於代理最終將面對的特定下游任務的領域知識。透過使用資訊論正則化器,系統確保所學習的技能具有區別性並涵蓋廣泛的行為。

階層學習架構

該框架基於階層結構運作,以提升探索和樣本效率:

  1. 技能獲取:代理首先在預訓練階段使用隨機神經網路架構學習一個技能庫。
  2. 高層策略訓練:在獲得這些技能後,會在這些預先存在的技能之上訓練高層策略。高層策略不學習原始動作,而是從學習到的技能中選擇以實現目標。

這種階層結構使代理能夠更有效地應對下游任務中的稀疏獎勵,因為高層策略可以透過使用複雜且有意義的行為(技能)來探索環境,而不是依賴隨機的原始動作。

效能與影響

實驗表明,隨機神經網路與資訊論正則化的結合在樣本高效的方式下對學習可解釋的技能是有效的。研究者發現,此方法能夠在廣泛的下游任務上均顯著提升學習效能。

透過結合內在動機和階層方法的優勢,此框架提供了一種可擴展的方式來學習複雜行為,而無需為每個新任務進行大量手動設計獎勵函數。

Sources