OpenAI Retro 競賽與 Gym Retro 發布
OpenAI 推出 Retro 競賽並發布 Gym Retro,旨在將強化學習(RL)研究從記憶轉向泛化。此競賽評估演算法將知識從訓練關卡轉移至先前未見過的電子遊戲關卡的能力。
Retro 競賽:測試強化學習的泛化能力
Retro 競賽衡量 RL 演算法是否能從先前的經驗中泛化,而非僅僅記憶特定環境。在傳統的 RL 研究中,演算法常在訓練時使用的相同環境中進行測試,這有利於那些擁有大量超參數、善於記憶的模型。
競賽結構與限制
- 任務:代理人會獲得來自 Sonic The Hedgehog 系列的訓練關卡集合,並在專為競賽設計的自訂測試關卡上進行評估。
- 時間表:競賽於 4 月 5 日至 6 月 5 日期間舉行。
- 訓練預算:雖然訓練期間可使用任何環境或資料集,但每個未見過的測試關卡的使用時間限制約為 18 小時(100 萬時間步)。
效能基準
基線結果顯示,RL 演算法的表現遠不及人類。人類僅玩一小時即可取得遠高於在測試關卡上玩了 18 小時的 RL 演算法的分數,即使這些演算法使用了遷移學習。
OpenAI 發布了一篇技術報告《Gotta Learn Fast:RL 泛化的新基準》,比較了多種演算法:
- PPO(近端策略最佳化):當網路先在訓練關卡上預訓練,再於測試關卡上微調時,效能幾乎翻倍,顯示遷移學習的可靠效果。
- Rainbow DQN:作為基線納入。
- JERK:一種針對 Sonic 優化的隨機猜測演算法,隨著訓練進行會更頻繁地重播最高分的動作序列。
Gym Retro:全新強化學習環境平台
Gym Retro 是一個將經典電子遊戲封裝為 RL 環境的系統,將可供研究使用的遊戲的複雜度與多樣性擴展至超越 Atari 2600。
技術能力與範圍
- 遊戲庫:首次發布包含 30 款 SEGA Genesis 遊戲(來自 SEGA Mega Drive 與 Genesis Classics Steam 捆綁包)以及來自 Arcade Learning Environment 的 62 款 Atari 2600 遊戲。
- 硬體優勢:相較於 Atari,SEGA Genesis 遊戲因硬體更強大而更為複雜,包括超過 500 倍的記憶體、更廣泛的控制輸入以及更佳的圖形表現。
- 泛化潛力:Genesis 遊戲的關卡常共享相同的物理與物件外觀,但在版面與道具上有所不同,因而非常適合測試遷移學習。
相較於先前實作的改進
- 彈性:與需要 C++ 程式碼定義環境的 RLE 不同,Gym Retro 使用 JSON 檔案,簡化了新遊戲的整合。
- 可靠性:Gym Retro 解決了 Universe 專案的問題,該專案因非同步環境、即時限制以及不可靠的螢幕畫面遊戲狀態偵測而失敗。
為研究人員提供的資源
為了促進參與與開發,OpenAI 提供了多項工具:
- Retro-baselines:一個 GitHub 倉庫,示範如何在競賽任務上執行各種 RL 演算法。
- Sonic Recordings:一套人類通關 Sonic 關卡的錄製資料集。這些資料允許代理人從關卡的隨機位置開始,以探索平時可能無法到達的區域,或透過示範學習進行訓練。
- 技術報告:詳細的基準資料與結果可在隨附的《Gotta Learn Fast》論文中取得。
Sources
- OriginalRetro Contest