OpenAI Retro コンテストと Gym Retro のリリース

OpenAI は Retro コンテストを開始し、Gym Retro をリリースして、強化学習 (RL) の研究を記憶に頼ることから汎化へとシフトさせました。このコンテストは、アルゴリズムが訓練レベルから未見のビデオゲームレベルへ知識を転移できるかを評価します。

Retro コンテスト: RL における汎化のテスト

Retro コンテストは、RL アルゴリズムが特定の環境を単に暗記するのではなく、過去の経験から汎化できるかどうかを測ります。従来の RL 研究では、アルゴリズムは訓練されたのと同じ環境でテストされることが多く、暗記に優れた多数のハイパーパラメータを持つモデルが有利になります。

コンテストの構成と制約

  • タスク: エージェントは Sonic The Hedgehog シリーズの訓練レベル集合を提供され、コンテスト専用に作成されたカスタムレベルのテスト集合で評価されます。
  • 期間: コンテストは 4 月 5 日から 6 月 5 日まで実施されます。
  • 訓練予算: 訓練時に使用できる環境やデータセットは自由ですが、未見のテストレベルごとに約 18 時間(1,000,000 タイムステップ)に制限されます。

パフォーマンスベンチマーク

ベースライン結果は、RL アルゴリズムの性能が人間より大幅に劣ることを示しています。人間はたった 1 時間のプレイで、テストレベルで 18 時間プレイさせた RL アルゴリズムよりはるかに高いスコアを達成しました。たとえ転移学習を利用したとしても同様です。

OpenAI は技術報告書 "Gotta Learn Fast: A New Benchmark for Generalization in RL" を公開し、複数のアルゴリズムを比較しました:

  • PPO (Proximal Policy Optimization): 訓練レベルで事前学習したネットワークをテストレベルで微調整すると、性能がほぼ 2 倍に向上し、転移学習の効果が信頼できることが示されました。
  • Rainbow DQN: ベースラインとして含まれています。
  • JERK: Sonic 用に最適化されたランダム推測アルゴリズムで、訓練が進むにつれて上位スコアのアクションシーケンスをより頻繁に再生します。

Gym Retro: 新しい RL 環境プラットフォーム

Gym Retro は、古典的なビデオゲームを RL 環境としてラップするシステムで、Atari 2600 を超える複雑さと多様性を研究に提供します。

技術的機能と範囲

  • ゲームライブラリ: 初回リリースには SEGA Mega Drive / Genesis Classics Steam バンドルからの 30 本の SEGA Genesis ゲームと、Arcade Learning Environment からの 62 本の Atari 2600 ゲームが含まれます。
  • ハードウェア上の優位性: SEGA Genesis のゲームは、RAM が 500 倍以上多く、コントロール入力の種類が豊富で、グラフィックも向上しているため、Atari のゲームよりもはるかに複雑です。
  • 汎化の可能性: Genesis のゲームは、物理特性やオブジェクトの外観は共通しているものの、レイアウトやアイテムが異なるレベルが多く、転移学習のテストに最適です。

以前の実装からの改善点

Gym Retro は Retro Learning Environment (RLE) と OpenAI の以前の "Universe" プロジェクトを改良しています:

  • 柔軟性: RLE が環境定義に C++ コードを必要としたのに対し、Gym Retro は JSON ファイルを使用するため、新しいゲームの統合が簡単です。
  • 信頼性: Universe プロジェクトは非同期環境、リアルタイム制約、画面ベースのゲーム状態検出の不安定さに悩まされていましたが、Gym Retro はこれらの問題を解消しています。

研究者向けサポートリソース

参加と開発を促進するために、OpenAI は以下のツールを提供しています:

  • Retro-baselines: コンテストタスクでさまざまな RL アルゴリズムを実行する方法を示す GitHub リポジトリ。
  • Sonic Recordings: 人間が Sonic レベルをクリアした録画データセット。エージェントはレベル内のランダムな地点から開始でき、通常は到達できない領域を探索したり、デモンストレーション学習による訓練に利用できます。
  • Technical Report: 付随する "Gotta Learn Fast" 論文にベンチマークデータと結果の詳細が掲載されています。

Sources