OpenAI 關於深度強化學習的基於計數的探索研究

TL;DR

OpenAI 已經提出經典基於計數探索的簡單推廣,該方法使用雜湊碼將高維狀態映射到雜湊表。此方法使基於計數的方法能夠擴展到高維和連續狀態空間,在 Atari 2600 遊戲和連續控制任務上達到接近最先進的性能。

將基於計數的探索擴展到高維空間

傳統基於計數的探索算法在使用表格強化學習的小型離散馬可夫決策過程(MDP)中表現近乎最優。然而,它們歷史上被認為不適用於高維或連續狀態空間,因為大多數狀態不太可能出現多次,使得簡單計數變得不可能。

為了克服這個挑戰,OpenAI 研究人員發現將狀態映射到雜湊碼可以有效地計算狀態出現次數。透過使用雜湊表來追蹤這些計數,智能體可以根據經典基於計數探索理論計算獎勵加成,從而為訪問自己新發現的狀態提供獎勵。

性能與基準測試

所提出的基於雜湊的計數方法在各種深度強化學習基準測試上達到接近最先進的性能,包括:

  • Atari 2600 遊戲:該方法為需要大量探索的 MDP 提供了強大的基線。

  • 連續控制任務:該方法在高維連續狀態空間中有效擴展。

此方法作為一個簡單但強大的基線,用於與更複雜的啟發式方法進行比較,例如那些依賴內在動機或在不確定性面前的樂觀主義的方法。

有效雜湊的關鍵因素

詳細分析顯示,用於探索的雜湊函數的效果至關重要。成功的雜湊函數必須具備兩個主要特徵:

  1. 適當的粒度:該函數必須將足夠相似的狀態映射到相同的雜湊碼,有效地將相似狀態分組在一起。

  2. 相關資訊編碼:該函數必須編碼與解決特定 MDP 相關的資訊。

研究人員發現,雖然簡單的雜湊函數可以獲得驚訝的好結果,但特定領域的學習雜湊碼可以進一步提升性能。

Sources