OpenAI 基於行動依賴分解基線的策略梯度變異降低
OpenAI 推出了一種利用行動依賴分解基線的策略梯度方法變異降低技術。此方法降低了梯度估計的高變異性,這是深度強化學習中的關鍵瓶頸,尤其在具有長時間跨度或高維度行動空間的問題上。
行動依賴基線用於變異降低
策略梯度方法常因梯度估計的高變異而受困,導致學習不穩定且收斂緩慢。為了解決此問題,OpenAI 研究人員推導出一種無偏差的行動依賴基線,利用隨機策略本身的結構形式。
與傳統的狀態依賴基線不同,此方法不對馬可夫決策過程(MDP)作額外假設,且保持無偏。研究人員證明,行動依賴基線在高維度控制問題中可優於最佳的狀態依賴基線,後者在此類問題上表現次佳。
高維度控制的效能
所提出的行動依賴基線方法計算效率高,且能有效擴展至高維度控制問題。研究人員透過一個合成的 2000 維目標匹配任務驗證了此效率,演算法成功擴展至如此高的維度。
在標準強化學習基準、 高維度手部操作任務以及合成任務的實驗結果顯示,使用行動依賴基線時,代理的學習速度更快。
擴展至部分可觀測與多代理任務
將額外資訊納入基線以提升變異降低的通用原則可擴展至標準 MDP 之外。研究人員展示此方法可應用於部分可觀測任務與多代理強化學習環境,進一步提升在複雜情境下的穩定性。
技術貢獻摘要
- 無偏差變異降低:一種利用策略結構形式的全新基線推導,降低梯度變異且不引入偏差。
- 可擴展性:在合成任務中於高維度行動空間(最高 2000 維)展示了效能。
- 學習速度:在標準 RL 基準與複雜手部操作任務上收斂更快。
- 通用性:可擴展至部分可觀測與多代理強化學習。