OpenAI 레트로 콘테스트 결과

TL;DR

OpenAI는 레트로 콘테스트의 첫 번째 라운드를 완료했습니다. 이 대회는 이전 경험으로부터 일반화할 수 있는 강화 학습(RL) 알고리즘 개발에 초점을 맞추었습니다. 결과는 Sonic 벤치마크가 일반 머신러닝 접근법을 테스트하는 데 효과적인 도구임을 보여주며, 최고 성능은 대회 전용 해킹보다 기존 알고리즘을 튜닝하고 확장함으로써 달성되었습니다.

성능 벤치마크 및 결과

대회에서 최고 성능을 보인 에이전트는 최대 점수 4,692점을 기록했으며, 이는 이론적 최대치인 10,000점에 비해 여전히 크게 낮은 수치입니다. 이 격차는 AI 에이전트가 새로운 환경에서 빠르게 일반화하고 학습할 수 있는 능력에 상당한 개선 여지가 있음을 나타냅니다.

최고 점수 팀

순위 점수
#1 Dharmaraja 4,692
#2 mistake 4,446
#3 aborg 4,430
#4 whatever 4,274
#5 Students of Plato 4,269
Baseline Joint PPO 4,070
Baseline Joint Rainbow 3,843
Baseline Rainbow 3,498

우승 솔루션의 기술적 접근법

우승 솔루션은 일반 머신러닝 기법에 의존했으며, 특히 Proximal Policy Optimization(PPO)과 Rainbow DQN의 정교화에 초점을 맞추었습니다.

Dharmaraja (1위)

팀 Dharmaraja는 여러 핵심 수정이 적용된 joint PPO 변형을 사용했습니다:

  • Visual Input: 흑백 이미지에서 RGB 이미지로 전환했습니다.
  • Action Space: 보다 일반적인 버튼 조합을 포함하도록 행동 공간을 확대했습니다.
  • Reward Function: 화면의 퍼셉추얼 해시를 이용해 새로운 상태를 방문할 때 보상을 주는 보강된 보상 함수를 구현했습니다.

mistake (2위)

팀 mistake는 Rainbow 베이스라인을 기반으로, Rainbow DQN을 처음부터 학습시켰습니다. 성능 향상은 다음에서 비롯되었습니다:

  • Hyper-parameter Tuning: n-step Q 학습을 위한 $n$ 값 최적화.
  • Architecture: 모델에 추가 CNN 레이어를 삽입해 성능을 개선했으며, 학습 속도는 다소 느려졌습니다.
  • Update Interval: DQN 타깃 업데이트 간격을 낮췄습니다.

aborg (3위)

팀 aborg는 joint PPO 변형을 사용하며 전이 학습과 빠른 적응에 중점을 두었습니다:

  • Pre-training: Game Boy Advance와 Master System Sonic 게임의 추가 레벨을 활용해 사전 학습을 진행했습니다.
  • Architecture: 네트워크 구조를 수정했습니다.
  • Hyper-parameter Optimization: 미세 조정 초기 150K 타임스텝을 안정화하기 위해 학습률을 특별히 튜닝했습니다.

평가 방법론

오버피팅을 방지하기 위해 OpenAI는 두 단계 평가 과정을 적용했습니다:

  1. Leaderboard Phase: 참가자들은 레벨 에디터로 만든 품질이 낮은 5개의 테스트 레벨에 대한 점수와 영상을 통해 피드백을 받았습니다.
  2. Final Evaluation: 상위 10명은 숙련된 레벨 디자이너가 만든 11개의 맞춤형 Sonic 레벨에 대해 테스트되었습니다. 각 에이전트는 레벨당 서로 다른 랜덤 시드를 사용해 3번씩 평가되어 노이즈를 감소시켰습니다.

주요 교훈 및 시사점

OpenAI는 가장 성공적인 접근법이 대회 이전에 OpenAI 내부에서 설정한 벤치마크와 크게 다르지 않다는 점을 관찰했습니다. 이는 두 가지 주요 발견을 강조합니다:

  • 하이퍼파라미터의 중요성: 최고 제출물은 기존 베이스라인 알고리즘(예: Rainbow DQN)의 세심하게 튜닝된 버전이 기본 설정보다 크게 우수함을 보여주었습니다.
  • Sonic 벤치마크의 검증: 우승 솔루션이 특정 해킹이 아닌 일반적인 머신러닝 접근법이었기 때문에, Sonic 벤치마크가 커뮤니티가 해결하기에 견고한 문제임을 OpenAI는 결론지었습니다.
  • 전이 학습: 사전 학습된 네트워크를 미세 조정하는 전략이 여러 상위 팀에게 성공적인 전략이었습니다.

Sources