OpenAI MADDPG: 협력, 경쟁 및 통신 학습하기

OpenAI는 에이전트가 협력, 경쟁 및 통신하는 법을 배워야 하는 다중 에이전트 환경을 위해 설계된 새로운 강화 학습(RL) 알고리즘인 MADDPG를 개발했습니다. 중앙 집중식 학습과 분산 실행(centralized learning with decentralized execution)을 활용함으로써, MADDPG는 에이전트가 행동을 조정하고 다른 에이전트의 행동에 적응할 수 있도록 하여 전통적인 분산 RL에 내재된 불안정성을 극복합니다.

중앙 집중식 학습 및 분산 실행

MADDPG는 Deep Deterministic Policy Gradient (DDPG) 알고리즘을 확장하여 actor-critic 강화 학습 기술을 통합합니다. 핵심 혁신은 각 에이전트를 위한 중앙 집중식 critic을 사용하는 것입니다.

  • The Actor: 시뮬레이션의 각 에이전트는 actor로서 행동하며, 자신의 관찰과 다른 에이전트의 행동에 대한 예측을 바탕으로 어떤 행동을 취할지 결정합니다.
  • The Centralized Critic: 학습 과정 동안 각 actor는 환경 내 모든 에이전트의 관찰과 행동에 접근할 수 있는 critic과 쌍을 이룹니다. 이 critic은 특정 상태에서 행동의 기대 미래 보상(가치)을 예측함으로써 actor에게 어떤 행동을 강화해야 할지에 대한 조언을 제공합니다.
  • Decentralized Execution: 에이전트는 테스트 시에 중앙 집중식 critic에 접근할 필요가 없습니다. 에이전트는 오직 자신의 관찰과 다른 에이전트의 행동에 대한 예측만을 바탕으로 작동합니다.

이러한 구조 덕분에 MADDPG는 보상이 서로 반대되는 적대적 사례를 포함하여 임의의 보상 구조를 모델링할 수 있으며, 예측 불가능한 다중 에이전트 환경을 학습 과정을 위해 예측 가능한 환경으로 변환합니다.

전통적인 RL의 한계 극복

DDPG, actor-critic 학습, deep Q-learning과 같은 전통적인 분산 RL 방식은 에이전트가 자신의 행동을 수행하는 동시에 타인의 행동을 예측하는 법을 동시에 배워야 하기 때문에 다중 에이전트 설정에서 어려움을 겪습니다. 이는 다른 에이전트가 학습함에 따라 한 에이전트의 정책이 변하는 비정상성(non-stationary) 환경을 생성하며, 에이전트가 안정적인 정책으로 수렴하는 것을 어렵게 만듭니다.

또한, 정책 경사(policy gradient) 방법은 종종 높은 분산을 보여 보상이 일관되지 않을 때 올바른 정책을 학습하기 어렵게 만듭니다. OpenAI는 분산 RL에 단순히 critic을 추가하는 것만으로는 협력적 통신과 같은 과제를 해결하는 데 여전히 실패한다는 것을 발견했습니다. 에이전트가 협력 전략을 개발하기 위해서는 학습 중에 타인의 행동을 고려해야 하기 때문입니다.

실증적 결과 및 역량

OpenAI는 다양한 과제에 대해 MADDPG를 테스트했으며, 모든 사례에서 DDPG보다 뛰어난 성능을 보였습니다. 입증된 역량은 다음과 같습니다:

  • Coordinated Chasing (협력 추격): 4개의 빨간색 에이전트가 2개의 초록색 에이전트를 추격하기 위해 팀을 이루는 법을 배웠고, 초록색 에이전트들은 포획을 피하고 목표물(파란색 원)에 도달하기 위해 흩어지는 법을 배웠습니다.
  • Strategic Hiding (전략적 은닉): 2개의 에이전트가 상대 에이전트에게 의도한 목적지를 숨기기 위해 흩어지는 법을 배웠습니다.
  • Cooperative Communication (협력적 통신): 1개의 에이전트가 다른 에이전트에게 랜드마크의 이름을 전달하는 법을 배웠습니다.
  • Collision Avoidance (충돌 방지): 3개의 에이전트가 충돌 없이 랜드마크로 이동하기 위해 움직임을 조정했습니다.

AGI에 대한 시사점

OpenAI는 다중 에이전트 환경을 인공 일반 지능(AGI)을 향한 중요한 디딤돌로 보고 있으며, 그 이유는 크게 두 가지입니다:

  1. Natural Curriculum (자연스러운 커리큘럼): 환경의 난이도는 경쟁자의 숙련도에 따라 자동으로 조절됩니다. 에이전트가 자신의 복제본과 경쟁한다면, 환경의 난이도는 그들의 현재 숙련도와 정확히 일치하게 됩니다.
  2. Lack of Stable Equilibrium (안정적 평형의 부재): 경쟁자를 능가하기 위해 더 똑똑해져야 한다는 압박이 항상 존재하기 때문에, 이러한 환경에서 에이전트의 지능에는 한계가 없습니다.

복잡한 시각적 입력을 처리하는 딥러닝의 능력과 장기적 행동을 학습하는 RL의 능력을 결합함으로써, MADDPG는 환경의 역학에 대한 사전 지식 없이도 고차원 환경에서의 통신과 언어 연구를 가능하게 합니다.

Sources