강화학습에서 일반화 정량화

OpenAI는 CoinRun을 공개했습니다. 이는 에이전트가 새로운 상황에 경험을 일반화하는 능력을 정밀하게 측정하도록 설계된 훈련 환경입니다. 이 환경은 강화학습(RL)에서 오랫동안 존재해 온 문제, 즉 에이전트가 일반화 가능한 기술을 배우기보다 훈련 환경의 구체적인 세부 사항에 과적합하는 문제를 해결합니다.

강화학습에서의 일반화 도전

딥 강화학습 알고리즘은 새로운 환경으로 경험을 전이하는 데 종종 어려움을 겪습니다. 에이전트가 복잡한 작업을 해결할 수는 있지만, 특정 환경 세부 사항에 집착해 과적합하는 경우가 많습니다. 이 문제는 RL 에이전트가 종종 훈련에 사용된 동일한 환경에서 벤치마크되는 광범위한 패턴의 일부이며, 연구자들은 이를 감독 학습에서 훈련 세트에 대한 테스트와 비교합니다.

Sonic 벤치마크, 절차적으로 생성된 그리드월드 미로, General Video Game AI 프레임워크를 사용한 이전 시도에서도 유사한 과적합 패턴이 나타났습니다. 예를 들어, Sonic 벤치마크에서 훈련된 에이전트는 훈련 레벨에서는 좋은 성능을 보였지만, 미세 조정 없이 테스트 레벨에서는 성능이 저조했습니다.

CoinRun 환경

CoinRun은 Sonic the Hedgehog과 같은 복잡한 게임보다 다루기 쉬우면서도 여전히 상당한 일반화 도전을 제공하도록 설계된 절차적 생성 플랫폼 게임 환경입니다.

규칙 및 목표

  • Goal: 에이전트는 레벨 끝에 있는 단일 코인을 수집해야 합니다.
  • Obstacles: 레벨에는 고정 및 비고정 장애물이 있으며, 장애물과 충돌하면 즉시 사망합니다.
  • Reward Structure: 코인을 수집할 때만 고정된 양의 양의 보상이 주어집니다.
  • Termination: 에이전트가 사망하거나 코인을 수집하거나 1,000 타임스텝에 도달하면 에피소드가 종료됩니다.

일반화 성능 평가

OpenAI는 Proximal Policy Optimization (PPO)을 사용해 2억 5,600만 타임스텝 동안 9개의 에이전트를 평가했습니다. 8개의 에이전트는 100부터 16,000까지 다양한 고정 레벨 집합에서 훈련되었으며, 1개의 에이전트는 동일한 레벨을 한 번도 반복하지 않는 제한 없는 레벨 집합에서 훈련되었습니다.

과적합에 대한 주요 발견

  • Data Volume: 4,000 이하의 훈련 레벨에서는 과적합이 크게 발생합니다. 16,000 훈련 레벨에서도 과적합이 지속됩니다.
  • Optimal Performance: 제한 없는 레벨 집합으로 훈련된 에이전트가 가장 좋은 성능을 보였으며, 약 200만 개의 서로 다른 레벨에 접근할 수 있었습니다.
  • Architecture Impact: IMPALA-CNN 아키텍처를 사용한 에이전트는 모든 훈련 세트 크기에서 Nature-CNN 베이스라인보다 일반화가 크게 향상되었습니다.

일반화 향상을 위한 기법

고정된 500 레벨 훈련 세트를 사용해 OpenAI는 일반화 격차를 줄이기 위한 여러 정규화 기법을 조사했습니다:

  • Environmental Stochasticity: 이 기법은 테스트된 다른 모든 방법보다 일반화를 더 크게 향상시켰습니다.
  • Data Augmentation and Batch Normalization: 두 방법 모두 일반화 성능을 크게 향상시켰습니다.
  • L2 Regularization and Dropout: 두 방법 모두 일반화 격차를 줄였으며, L2 정규화가 더 큰 영향을 미쳤습니다.

확장: CoinRun-Platforms 및 RandomMazes

과적합을 더 깊이 조사하기 위해 OpenAI는 두 가지 추가 환경을 개발했습니다:

  • CoinRun-Platforms: 에이전트가 더 큰 고정 크기 레벨의 플랫폼에 흩어져 있는 여러 코인을 수집해야 하는 변형으로, 더 활발한 탐색과 기억을 요구합니다.
  • RandomMazes: 간단한 미로 탐색 환경.

두 경우 모두 에이전트는 강하게 과적합했습니다. RandomMazes에서는 20,000 레벨로 훈련했음에도 여전히 큰 일반화 격차가 남아 있었으며, 이를 해결하기 위해 IMPALA-CNN 아키텍처에 LSTM을 추가해 기억을 확보해야 했습니다.

향후 연구 방향

OpenAI는 RL 일반화를 개선하기 위한 세 가지 주요 연구 영역을 제시합니다:

  1. 환경 복잡도와 효과적인 일반화를 위해 필요한 레벨 수 사이의 관계 조사.
  2. 다른 순환 아키텍처가 일반화에 더 적합한지 여부 판단.
  3. 다양한 정규화 방법을 결합하는 가장 효과적인 방법 탐색.

Sources