量化強化學習中的泛化能力
OpenAI 已發布 CoinRun,一個訓練環境,旨在為代理將經驗泛化到新情境的能力提供精確指標。此環境解決了強化學習(RL)長期以來的挑戰,即代理常常過度擬合於訓練環境的具體細節,而非學習可泛化的技能。
強化學習中的泛化挑戰
深度強化學習演算法常常難以將經驗轉移到新環境。雖然代理能解決複雜任務,但它們常因依賴特定環境細節而過度擬合。此問題屬於更廣泛的模式,即 RL 代理通常在與訓練時相同的環境上進行基準測試,研究人員將其比作監督式學習中在訓練集上測試。
先前使用 Sonic 基準、程序生成的 gridworld 迷宮以及 General Video Game AI 框架來解決此問題的嘗試,也顯示出類似的過度擬合模式。例如,在 Sonic 基準上訓練的代理在訓練關卡上表現良好,但在未經微調的測試關卡上表現不佳。
CoinRun 環境
CoinRun 是一個程序生成的平台遊戲環境,設計上比起像 Sonic the Hedgehog 這類複雜遊戲更易處理,同時仍提供顯著的泛化挑戰。
規則與目標
- Goal: 代理必須收集位於關卡末端的單枚硬幣。
- Obstacles: 關卡包含固定與非固定障礙物;與任何障礙物碰撞即會立即死亡。
- Reward Structure: 只有在收集硬幣時才會給予固定的正向常數獎勵。
- Termination: 當代理死亡、收集硬幣或達到 1,000 個時間步時,回合結束。
評估泛化效能
OpenAI 使用近端策略最佳化(PPO)對九個代理進行了 2.56 億時間步的評估。八個代理在固定的關卡集合上訓練,關卡數量介於 100 到 16,000 不等;另一個代理則在無限制的關卡集合上訓練,從未遇到過相同的關卡兩次。
過度擬合的主要發現
- Data Volume: 當訓練關卡少於 4,000 時會出現顯著的過度擬合,即使在 16,000 個訓練關卡下仍會持續過度擬合。
- Optimal Performance: 使用無限制關卡集合訓練的代理表現最佳,因為它們可取得最多的資料(約 200 萬個不同關卡)。
- Architecture Impact: 使用 IMPALA-CNN 架構的代理在所有訓練集規模下的泛化表現顯著優於使用 Nature-CNN 基線的代理。
改善泛化的技術
OpenAI 以固定的 500 關卡訓練集,研究了多種正則化技術以縮小泛化差距:
- Environmental Stochasticity: 此技術在所有測試方法中對泛化的提升幅度最大。
- Data Augmentation and Batch Normalization: 兩者皆顯著提升了泛化效能。
- L2 Regularization and Dropout: 兩者皆減少了泛化差距,其中 L2 正則化的影響較為顯著。
擴展:CoinRun-Platforms 與 RandomMazes
為了進一步探討過度擬合,OpenAI 開發了兩個額外環境:
- CoinRun-Platforms: 一種變體,代理必須在較大、固定尺寸的關卡中收集散布於平台上的多枚硬幣,需更積極的探索與記憶。
- RandomMazes: 一個簡單的迷宮導航環境。
在兩種情況下,代理皆出現嚴重的過度擬合。在 RandomMazes 中,即使在 20,000 關卡上訓練,仍存在顯著的泛化差距,因而需要使用 IMPALA-CNN 架構,並搭配 LSTM 以提供記憶功能。
未來研究方向
OpenAI 建議未來研究在提升 RL 泛化方面可聚焦於三個主要領域:
- 探討環境複雜度與有效泛化所需關卡數量之關係。
- 判斷不同的循環架構是否更適合泛化。
- 研究結合不同正則化方法的最佳方式。