OpenAI 레트로 콘테스트 결과
TL;DR
OpenAI는 레트로 콘테스트의 첫 번째 라운드를 완료했습니다. 이 대회는 이전 경험으로부터 일반화할 수 있는 강화 학습(RL) 알고리즘 개발에 초점을 맞추었습니다. 결과는 Sonic 벤치마크가 일반 머신러닝 접근법을 테스트하는 데 효과적인 도구임을 보여주며, 최고 성능은 대회 전용 해킹보다 기존 알고리즘을 튜닝하고 확장함으로써 달성되었습니다.
성능 벤치마크 및 결과
대회에서 최고 성능을 보인 에이전트는 최대 점수 4,692점을 기록했으며, 이는 이론적 최대치인 10,000점에 비해 여전히 크게 낮은 수치입니다. 이 격차는 AI 에이전트가 새로운 환경에서 빠르게 일반화하고 학습할 수 있는 능력에 상당한 개선 여지가 있음을 나타냅니다.
최고 점수 팀
| 순위 | 팀 | 점수 |
|---|---|---|
| #1 | Dharmaraja | 4,692 |
| #2 | mistake | 4,446 |
| #3 | aborg | 4,430 |
| #4 | whatever | 4,274 |
| #5 | Students of Plato | 4,269 |
| Baseline | Joint PPO | 4,070 |
| Baseline | Joint Rainbow | 3,843 |
| Baseline | Rainbow | 3,498 |
우승 솔루션의 기술적 접근법
우승 솔루션은 일반 머신러닝 기법에 의존했으며, 특히 Proximal Policy Optimization(PPO)과 Rainbow DQN의 정교화에 초점을 맞추었습니다.
Dharmaraja (1위)
팀 Dharmaraja는 여러 핵심 수정이 적용된 joint PPO 변형을 사용했습니다:
- Visual Input: 흑백 이미지에서 RGB 이미지로 전환했습니다.
- Action Space: 보다 일반적인 버튼 조합을 포함하도록 행동 공간을 확대했습니다.
- Reward Function: 화면의 퍼셉추얼 해시를 이용해 새로운 상태를 방문할 때 보상을 주는 보강된 보상 함수를 구현했습니다.
mistake (2위)
팀 mistake는 Rainbow 베이스라인을 기반으로, Rainbow DQN을 처음부터 학습시켰습니다. 성능 향상은 다음에서 비롯되었습니다:
- Hyper-parameter Tuning: n-step Q 학습을 위한 $n$ 값 최적화.
- Architecture: 모델에 추가 CNN 레이어를 삽입해 성능을 개선했으며, 학습 속도는 다소 느려졌습니다.
- Update Interval: DQN 타깃 업데이트 간격을 낮췄습니다.
aborg (3위)
팀 aborg는 joint PPO 변형을 사용하며 전이 학습과 빠른 적응에 중점을 두었습니다:
- Pre-training: Game Boy Advance와 Master System Sonic 게임의 추가 레벨을 활용해 사전 학습을 진행했습니다.
- Architecture: 네트워크 구조를 수정했습니다.
- Hyper-parameter Optimization: 미세 조정 초기 150K 타임스텝을 안정화하기 위해 학습률을 특별히 튜닝했습니다.
평가 방법론
오버피팅을 방지하기 위해 OpenAI는 두 단계 평가 과정을 적용했습니다:
- Leaderboard Phase: 참가자들은 레벨 에디터로 만든 품질이 낮은 5개의 테스트 레벨에 대한 점수와 영상을 통해 피드백을 받았습니다.
- Final Evaluation: 상위 10명은 숙련된 레벨 디자이너가 만든 11개의 맞춤형 Sonic 레벨에 대해 테스트되었습니다. 각 에이전트는 레벨당 서로 다른 랜덤 시드를 사용해 3번씩 평가되어 노이즈를 감소시켰습니다.
주요 교훈 및 시사점
OpenAI는 가장 성공적인 접근법이 대회 이전에 OpenAI 내부에서 설정한 벤치마크와 크게 다르지 않다는 점을 관찰했습니다. 이는 두 가지 주요 발견을 강조합니다:
- 하이퍼파라미터의 중요성: 최고 제출물은 기존 베이스라인 알고리즘(예: Rainbow DQN)의 세심하게 튜닝된 버전이 기본 설정보다 크게 우수함을 보여주었습니다.
- Sonic 벤치마크의 검증: 우승 솔루션이 특정 해킹이 아닌 일반적인 머신러닝 접근법이었기 때문에, Sonic 벤치마크가 커뮤니티가 해결하기에 견고한 문제임을 OpenAI는 결론지었습니다.
- 전이 학습: 사전 학습된 네트워크를 미세 조정하는 전략이 여러 상위 팀에게 성공적인 전략이었습니다.
Sources
- OriginalRetro Contest: Results