OpenAI Five 벤치마크 결과
OpenAI Five는 99.95번째 백분위수 Dota 플레이어 팀과의 3전 2선승제 시리즈에서 승리했으며, 여기에는 프로 플레이어 네 명인 Blitz, Cap, Fogged, Merlini, MoonMeander가 포함됩니다. 이 결과는 현실 세계 환경에 내재된 높은 복잡성과 불확실성을 관리할 수 있는 AI 시스템으로 나아가는 중요한 단계임을 보여줍니다.
경기 결과 및 성능
OpenAI Five는 초안(draft)과 상대 실력 수준에 따라 세 가지 구별된 경기 유형에서 성공 정도가 달랐습니다:
고숙련 인간 경기
99.95번째 백분위수 인간 팀과의 3전 2선승제 시리즈에서 OpenAI Five는 처음 두 경기를 승리했습니다. 첫 번째 경기는 21분 37초에, 두 번째 경기는 24분 53초에 승리했습니다. 세 번째 경기에서는 관객이 AI를 위한 적대적인 영웅 라인업을 선택하면서 인간 팀이 승리했으며, OpenAI Five는 35분 47초에 패배했습니다.
관객 자원봉사자 경기
관객 자원봉사자 팀과의 초기 공개 경기에서 OpenAI Five는 첫 14분 이내에 승리했으며, 이는 일반적으로 균형 잡힌 경기의 45분 지속 시간보다 훨씬 빠른 결과였습니다.
적대적 초안
고숙련 팀과의 세 번째 경기에서 관객은 Sven, Axe, Slark, Riki, Queen of Pain으로 구성된 "Looney-Tunes" 라인업을 OpenAI Five에게 선택했습니다. 이 적대적인 선택으로 인해 OpenAI Five는 경기 시작 전에 자신의 승리 확률을 단 2.9%로 예측했습니다.
기술 구현 및 초안
OpenAI Five는 승리 확률 출력을 가진 신경망을 활용하여 게임 상태와 초안 매치를 평가합니다.
자동 초안
시스템이 영웅을 초안하는 능력을 처리하기 위해 OpenAI Five는 1,100만 개의 가능한 팀 매치업 중 최적의 초안을 찾기 위해 트리 탐색을 사용합니다. 이 과정은 각 매치업에 대해 가짜 프레임을 생성하고, 첫 번째 프레임에서 신경망의 승리 확률 예측을 사용해 잠재적인 결과를 평가하는 것을 포함합니다.
모델 내성
AI의 내부 예측은 종종 인간 인식과 달랐습니다. 예를 들어, 게임 1에서 OpenAI Five는 인간 관찰자들이 매치업이 동등하다고 믿음에도 불구하고 95%의 승리 확률을 예측했습니다. 게임 2에서는 76.2%의 승리 확률을 예측했습니다.
훈련 방법론 및 컴퓨팅
OpenAI Five는 각 버전을 처음부터 훈련하는 대신, 여러 시스템 개정판에 걸쳐 지속적인 파라미터 초기화를 이용해 훈련되었습니다.
파라미터 수술
OpenAI는 기존 파라미터를 새로운 네트워크 구조에 매핑하기 위한 "surgery" 도구를 개발했습니다. 이를 통해 이동과 와드 설치에 모두 사용되는 단일 액션 헤드를 두 개의 별도 복제본으로 분할하는 등 특정 행동을 정교화하여 AI가 이동 중에 와드를 놓는 것을 방지할 수 있었습니다.
컴퓨팅 자원
다양한 Dota 시스템을 훈련하는 데 사용된 추정 컴퓨팅량은 다음과 같습니다:
- 1v1 model: 8 petaflop/s-days
- June 6th model: 11 petaflop/s-days
- August 5th model: 35 petaflop/s-days
모델 계획 및 예측
OpenAI는 모델의 계획 능력에 대한 통찰을 제공하기 위해 출력이 미래 게임 상태를 예측하도록 훈련했습니다. 여기에는 영웅(예: Sven)의 위치를 6초 후에 예측하는 것과 타워 수, 마지막 타격 횟수와 같은 다른 양을 예측하는 것이 포함됩니다.
Sources
- OriginalOpenAI Five Benchmark: Results