OpenAI Five

OpenAI Five, 다섯 개의 신경망으로 구성된 팀, Dota 2에서 아마추어 인간 팀을 이기기 시작했습니다.

Model Structure

OpenAI Five의 각 영웅은 별도의 단일 레이어 1024유닛 LSTM으로 제어되며, 이는 20,000차원 관측값을 처리하고 열거형 값 heads 여덟 개를 통해 행동을 내보냅니다.

Training Approach

OpenAI Five는 256개의 GPU와 128,000개의 CPU 코어에서 실행되는 확장된 Proximal Policy Optimization 알고리즘을 사용하여 entièrement self‑play로부터 학습하며, 하루에 약 180년分の 게임플레이 경험을 수집합니다.

Exploration

에이전트는 현재 자신의 자와 80%의 게임을 하고 과거 자신의 자와 20%의 게임을 하며, 무작위 레인 할당과 유닛 속성을 가지고, 순 가치, 킬, 데스, 어시스트, 라스트 히트 등으로 보상을 받고, 상대 팀의 평균 보상을 빼줍니다.

Coordination

팀워크는 훈련 중에 0에서 1로 어닐링되는 "팀 스피릿" 하이퍼파라미터에서 발생하며, 명시적인 통신 채널 없이 각 영웅의 개별 보상을 팀 평균 보상에 가중합니다.

System Infrastructure

훈련은 경험을 수집하는 롤아웃 워커와 동시 경사 하강을 수행하는 옵티마이저 노드를 분리하는 Rapid 프레임워크에서 수행되며, 경험은 Redis를 통해 동기화되고 그래디언트는 NCCL2 래퍼를 사용하여 평균화됩니다; Rapid는 Kubernetes, Azure, GCP 백엔드에서 실행됩니다.

Gameplay Results

OpenAI Five는 4.2k MMR (93rd percentile) 아마추어 팀을 물리쳤고, 점진적인 개선 후에는 최고의 OpenAI 직원 팀 (2.5k MMR, 46th percentile), Valve 직원 팀 (2.5‑4k MMR, 46‑90th percentile)을 이겼고, 세미프로 팀 (5.5k MMR, 99th percentile)과 함께 훈련하는 아마추어 팀과의 비공식 스크림 세 번 중 두 번을 이겼습니다.

Differences Versus Humans

OpenAI Five는 전체 게임 상태를 즉시 받으며, 분당 150‑170개의 행동을 평균적으로 수행합니다 (이론상 최대 450), 약 80 ms에 반응하며, 이는 인간 반응 시간보다 빠릅니다.

Surprising Findings

이진 승패 보상만으로는 학습 속도가 한 자리 수 정도 느려졌으며, 명시적 보상 없이 크리프 블로킹이 나타났으며, 시스템은 레벨 25에서 드문 크래시나 큰 부정적 보상과 같은 심각한 버그를 포함하고 있음에도 강한 인간을 이길 수 있었습니다.

Future Plans

팀은 2018년 8월 The International에서 제한된 영웅 세트로 탑‑프로페셔널 라인업과 경기를 목표로 하며, 진행 중에 업데이트를 출시하고 프로젝트 완료 후 최종 보고서를 출판할 계획입니다.

Sources