OpenAI Random Network Distillation (RND) 강화 학습용

OpenAI는 예측 기반 방법인 Random Network Distillation (RND)을 개발했으며, 이는 강화 학습(RL) 에이전트가 호기심을 통해 환경을 탐색하도록 장려합니다. 이 접근법은 고정된 무작위 신경망의 출력을 예측하는 난이도에 따라 보상을 제공함으로써 에이전트가 익숙하지 않은 상태를 방문하도록 합니다. 처음으로 이 방법은 Atari 게임 Montezuma's Revenge에서 평균 인간 성능을 초과했으며, 최첨단 성능을 달성하고 인간 시연이나 기본 에뮬레이터 상태에 접근하지 않고도 24개의 방을 모두 찾아 첫 번째 레벨을 가끔 해결했습니다.

Random Network Distillation (RND) 기술 개요

Random Network Distillation은 익숙하지 않은 상태의 탐색을 장려하도록 설계되었습니다. 시스템은 고정된 무작위 초기화된 신경망을 목표(target)로 사용합니다. 두 번째 네트워크인 예측기(predictor)는 다음 상태를 입력으로 받아 이 목표 네트워크의 출력을 예측하려고 합니다.

예측기 네트워크는 에이전트가 방문한 상태에 대해 학습되기 때문에, 자주 방문한 상태에서는 예측 오류가 낮고 새로운 상태에서는 오류가 높습니다. 이 예측 오류는 내재적 보상으로 작용하여 에이전트를 환경의 미탐색 영역으로 이끕니다.

Noisy-TV 문제 해결

이전의 다음 상태 예측 기반 호기심 구동 방법은 "noisy-TV 문제"에 취약했습니다. 이 문제는 환경의 확률적 요소(예: 무작위 잡음이 나오는 TV) 때문에 에이전트가 지속적으로 예측 불가능한 상황에 갇혀 높은 내재적 보상을 얻게 되는 현상입니다.

RND는 환경 자체의 다음 상태를 예측하는 대신, 결정론적인 합성 문제(고정된 무작위 네트워크)의 출력을 예측하는 데 집중함으로써 이 문제를 제거합니다. 이를 통해 예측 오류가 확률성보다는 새로움에 의해 발생하도록 하여 RND가 noisy-TV 문제에 면역이 되게 합니다.

Montezuma's Revenge 성능

Montezuma's Revenge는 간단한 탐색 전략으로는 보상을 얻기 어려워 RL에서 탐색의 벤치마크로 널리 여겨집니다. 원래 DQN 논문에서 이 게임은 에이전트가 평균 인간 점수의 0% (4.7K)만 달성한 유일한 게임이었습니다.

RND를 사용하여 OpenAI는 다음과 같은 결과를 달성했습니다:

  • 대규모 실험: 1024개의 rollout worker를 사용하여 에이전트는 9번의 실행에서 평균 10K의 반환을 달성했으며, 최고 평균 반환은 14.5K였습니다. 대부분의 실행에서 20~22개의 방을 발견했습니다.
  • 장기 실험: 10번 중 한 번의 실행에서 최고 반환 17.5K를 달성했으며, 이는 첫 번째 레벨을 통과하고 24개의 방을 모두 찾은 것에 해당합니다.

환경 전반에 걸친 호기심 기반 학습

OpenAI는 환경별(외재적) 보상 없이 50개 이상의 다양한 환경에서 대규모 연구를 수행했습니다. 에이전트들은 다양한 수준의 역량을 보여주었습니다:

  • Super Mario Bros: 에이전트는 11개의 레벨을 발견하고 비밀 방을 찾아 보스를 물리쳤으며, 내재적 보상이 게임의 진행 목표와 잘 맞아떨어졌습니다.
  • Bowling: 에이전트는 클리핑된 외재적 보상으로 훈련된 에이전트보다 성능이 뛰어났으며, 이는 스트라이크 후 점수판이 예측 불가능하게 깜빡이는 현상에 매료되었기 때문으로 보입니다.
  • Pong: 에이전트는 라리를 오래 지속하기 위해 공을 계속 플레이하도록 학습했으며, 승리보다 게임을 오래 지속하는 것을 우선시했습니다.
  • Breakout: 에이전트는 새로운 벽돌 배치에 직면하거나 레벨을 처음 통과할 때 내재적 보상의 급증을 경험했습니다.

구현 및 훈련 안정성

OpenAI는 RND 성공에 구현 세부 사항이 중요하다고 언급합니다. 특징 포화 현상을 피하고 내재적 보상을 예측 가능한 범위로 조정함으로써 안정성을 확보했습니다. 팀은 버그가 수정될 때마다 성능이 크게 향상되는 것을 발견했으며, 이는 더 간단한 알고리즘이 디버깅과 안정성 측면에서 종종 더 바람직함을 강조합니다.

탐색 보너스를 외재적 보상과 통합하기 위해 OpenAI는 두 보상 흐름을 위한 두 개의 별도 가치 헤드를 가진 Proximal Policy Optimization (PPO) 변형을 사용했습니다. 이를 통해 서로 다른 할인율과 에피소드형 및 비에피소드형 반환을 결합할 수 있습니다.

Sources