OpenAI 상대 학습 인식을 고려한 학습 (LOLA)

TL;DR

OpenAI는 상대 학습 인식을 고려한 학습(LOLA)을 도입했습니다. 이는 다중 에이전트 환경에 맞게 설계된 강화 학습 방법입니다. LOLA는 에이전트가 상대의 예상 학습을 적극적으로 형성하게 하여, 반복 죄수의 딜레마(IPD)와 같은 사회적 딜레마에서 협력의 출현을 가능하게 하고, 반복 매칭 페니와 같은 제로섬 게임에서 나시 균형으로 수렴하도록 합니다.

다중 에이전트 RL에서의 비정상성의 도전

다중 에이전트 강화 학습(MARL)에서 환경은 모든 에이전트가 동시에 학습하고 정책을 업데이트하기 때문에 비정상적이 됩니다. 이 비정상성은 종종 불안정한 훈련이나 원하지 않는 최종 결과로 이어집니다. 이 도전은 깊은 다중 에이전트 RL, 계층적 RL, 고차Gradient 기반 방법, 생성적 적대 네트워크(GANs)와 같은 다양한 설정에 적용됩니다.

LOLA 알고리즘: 상대 학습 형성

상대 학습 인식을 고려한 학습(LOLA)은 한 에이전트의 현재 정책이 다른 에이전트가 파라미터를 어떻게 업데이트할지에 미치는 영향을 명시적으로 고려하는 학습 규칙입니다. 상대를 환경의 일부로 취급하는 대신, LOLA 에이전트는 상대의 미래 파라미터 업데이트를 예상하고 그 학습 과정을 형성하기 위해 자신의 정책을 최적화합니다.

주요 기술적 구현 세부 사항은 다음과 같습니다:

  • 파라미터 업데이트 규칙: LOLA 업데이트 규칙은 한 에이전트의 정책이 다른 에이전트의 예상 파라미터 업데이트에 미치는 영향을 고려하는 특정 항을 포함합니다.
  • 확장성: LOLA 업데이트 규칙은 정책 그래디언트 추정기의 확장을 사용하여 효율적으로 계산할 수 있습니다. 이로써 모델 프리 RL에 적합하며, 큰 파라미터 공간, 큰 입력 공간, 비선형 함수 근사기로 확장할 수 있게 됩니다.

성능 및 결과

OpenAI 연구원들은 LOLA를 적용했으며, LOLA 에이전트는 여러 벤치마크에서 우수한 성능을 보였습니다:

  • 반복 죄수의 딜레마(IPD): 두 LOLA 에이전트의 만남에서 tit-for-tat 전략과 협력의 출현이 발생했으며, 독립 학습 에이전트는 이를 달성하지 못했습니다. LOLA 에이전트는 naive 학습자보다 더 높은 보상을 얻었고, 고차Gradient 기반 방법에 의한 악용에 대해서도 강건함을 유지했습니다.
  • 반복 매칭 페니: 이 제로섬 게임에서 LOLA 에이전트는 나시 균형으로 수렴했습니다.
  • 라운드 로빈 토너먼트: 기존 문헌의 다양한 다중 에이전트 학습 알고리즘과의 토너먼트에서 LOLA 에이전트는 IPD에서 가장 높은 평균 수익을 달성했습니다.
  • 그리드 월드 작업: 내장된 사회적 딜레마가 있는 그리드 월드 작업에서 LOLA 에이전트는 순환 정책과 상대 모델링을 사용하여 자기 이익으로부터 협력을 학습했습니다.

다중 에이전트 시스템에 대한 함의

다른 에이전트의 학습을 명시적으로 고려함으로써, LOLA는 개인의 자기 이익이 일반적으로 비최적 결과를 초래하는 환경에서 에이전트가 협력을 배울 수 있는 메커니즘을 제공합니다. 이 접근 방식은 에이전트의 관점을 현재 정책에 반응하는 것에서 벗어나, 대신 동일한 상대의 미래 학습 경로를 영향을 미치는 데 초점을 맞춥니다.

Sources