OpenAI 레트로 콘테스트 및 Gym Retro 출시
OpenAI는 강화 학습(RL) 연구를 암기에 의존하는 방식에서 일반화로 전환하기 위해 레트로 콘테스트를 시작하고 Gym Retro를 출시했습니다. 이 콘테스트는 알고리즘이 훈련 레벨에서 얻은 지식을 이전에 보지 못한 비디오 게임 레벨로 전이할 수 있는 능력을 평가합니다.
레트로 콘테스트: RL에서 일반화 테스트
레트로 콘테스트는 RL 알고리즘이 특정 환경을 단순히 암기하는 것이 아니라 이전 경험으로부터 일반화할 수 있는지를 측정합니다. 전통적인 RL 연구에서는 알고리즘을 훈련된 동일한 환경에서 테스트하는 경우가 많아, 암기에 뛰어난 많은 하이퍼파라미터를 가진 모델에 유리합니다.
콘테스트 구조 및 제약 조건
- Task: 에이전트에게 Sonic The Hedgehog 시리즈의 레벨 훈련 세트가 제공되며, 콘테스트를 위해 특별히 만든 사용자 정의 레벨 테스트 세트로 평가됩니다.
- Timeline: 콘테스트는 4월 5일부터 6월 5일까지 진행됩니다.
- Training Budget: 훈련 중에는 어떤 환경이나 데이터셋도 사용할 수 있지만, 에이전트는 각 보지 못한 테스트 레벨에서 약 18시간(1백만 타임스텝)으로 제한됩니다.
성능 벤치마크
베이스라인 결과에 따르면 RL 알고리즘은 인간보다 현저히 낮은 성능을 보입니다. 인간은 단 1시간만 플레이해도 테스트 레벨에서 18시간을 플레이한 RL 알고리즘보다 훨씬 높은 점수를 기록했으며, 이는 해당 알고리즘이 전이 학습을 사용했을 때도 마찬가지였습니다.
OpenAI는 "Gotta Learn Fast: A New Benchmark for Generalization in RL"이라는 기술 보고서를 발표했으며, 여기서는 여러 알고리즘을 비교합니다:
- PPO (Proximal Policy Optimization): 네트워크를 훈련 레벨에서 사전 학습한 뒤 테스트 레벨에서 미세 조정하면 성능이 거의 두 배가 되어 전이 학습의 확실한 효과를 보여줍니다.
- Rainbow DQN: 베이스라인으로 포함되었습니다.
- JERK: Sonic에 최적화된 무작위 추측 알고리즘으로, 훈련이 진행될수록 상위 점수 행동 시퀀스를 더 자주 재생합니다.
Gym Retro: 새로운 RL 환경 플랫폼
Gym Retro는 클래식 비디오 게임을 RL 환경으로 래핑하도록 설계된 시스템으로, Atari 2600을 넘어선 복잡하고 다양한 게임을 연구에 활용할 수 있게 합니다.
기술적 기능 및 범위
- Game Library: 초기 릴리스에는 SEGA Mega Drive와 Genesis Classics Steam Bundle에서 제공되는 30개의 SEGA Genesis 게임과 Arcade Learning Environment에서 제공되는 62개의 Atari 2600 게임이 포함됩니다.
- Hardware Advantages: SEGA Genesis 게임은 RAM이 500배 이상 많고, 입력 컨트롤이 다양하며, 그래픽이 향상된 등 하드웨어가 뛰어나 Atari 게임보다 훨씬 복잡합니다.
- Generalization Potential: Genesis 게임은 물리와 객체 외형은 공유하지만 레이아웃과 아이템이 달라 전이 학습을 테스트하기에 이상적입니다.
이전 구현 대비 개선점
Gym Retro는 Retro Learning Environment (RLE)와 OpenAI의 이전 "Universe" 프로젝트를 개선합니다:
- Flexibility: RLE가 환경 정의에 C++ 코드를 요구했던 것과 달리, Gym Retro는 JSON 파일을 사용해 새로운 게임을 쉽게 통합할 수 있습니다.
- Reliability: Gym Retro는 비동기 환경, 실시간 제약, 화면 기반 게임 상태 감지의 신뢰성 부족 등으로 고통받던 Universe 프로젝트의 문제점을 해결했습니다.
연구자를 위한 지원 자료
참여와 개발을 촉진하기 위해 OpenAI는 여러 도구를 제공했습니다:
- Retro-baselines: 콘테스트 과제에 다양한 RL 알고리즘을 실행하는 방법을 보여주는 GitHub 저장소입니다.
- Sonic Recordings: 인간이 Sonic 레벨을 클리어한 녹음 데이터셋입니다. 이를 통해 에이전트는 레벨 내 임의 지점에서 시작해 스스로 도달하기 어려운 영역을 탐색하거나 시연 학습을 통해 훈련할 수 있습니다.
- Technical Report: 상세한 벤치마크 데이터와 결과는 동봉된 "Gotta Learn Fast" 논문에서 확인할 수 있습니다.
Sources
- OriginalRetro Contest