OpenAI Gym Beta 版發布

OpenAI 已發布 OpenAI Gym 的公開 Beta 版,這是一個用於開發與比較強化學習(RL)演算法的工具包。此版本提供了一套標準化的環境以及一個用於重現與比較研究結果的平台,解決了 RL 基準測試中缺乏一致性與多樣性的問題。

Standardizing Reinforcement Learning Benchmarks

OpenAI Gym 旨在解決 RL 研究中的兩個主要瓶頸:缺乏多樣且易於使用的基準測試,以及環境定義缺乏標準化。在監督學習中,進步是由像 ImageNet 這樣的大型標註數據集推動的;OpenAI Gym 透過提供多樣化的環境集合(從模擬機器人到 Atari 遊戲),為 RL 提供類似的功能。

標準化至關重要,因為獎勵函數或動作集合的微小變化可能會顯著改變任務的難度。透過提供一致的環境集合,OpenAI Gym 使研究人員能夠更準確地重現已發表的研究,並比較不同論文的結果。

Toolkit Capabilities and Compatibility

OpenAI Gym 的設計是與框架無關的,使其能與任何框架編寫的演算法相容,例如 TensorFlow 與 Theano。儘管目前的環境是用 Python 編寫的,OpenAI 計畫未來讓這些環境能夠從其他程式語言存取。

Approach to Evaluation and Results

OpenAI Gym 避免使用傳統的排行榜,以防止過度擬合或為特定任務創造手工製作的解決方案。相反地,焦點放在所開發技術的普遍性上。

為了追蹤進展,OpenAI 正在維護一份展示有趣演算法能力的貢獻清單。長期目標是讓這個策展過程成為社群驅動的工作,而非由 OpenAI 集中擁有的過程。

Sources