협력하고 경쟁하며 소통하기 – OpenAI 2017 연구 발표
TL;DR
OpenAI는 다중 에이전트 강화 학습에서 중앙 집중식 학습과 분산 실행을 위한 MADDPG 알고리즘을 공개했으며, 이를 통해 에이전트가 기존 방법보다 협력, 경쟁 및 소통을 더 잘 학습할 수 있음을 보여줍니다.
소개
에이전트들이 자원을 놓고 경쟁하는 다중 에이전트 환경은 AGI를 향한 디딤돌로 여겨집니다. 이러한 환경은 자연스러운 커리큘럼을 제공하는데, 난이도가 경쟁자의 실력에 맞춰지고, 안정적인 균형점이 없어 지속적인 개선 압력을 만들어냅니다.
전통적인 RL이 겪는 어려움
DDPG, actor‑critic, deep Q‑learning과 같은 전통적인 분산 RL 접근법은 다중 에이전트 설정에서 어려움을 겪습니다. 각 에이전트는 다른 에이전트의 행동을 예측하면서 동시에 스스로 행동해야 하며, 특히 경쟁 상황에서는 더욱 복잡해집니다. 정책 그래디언트 방법은 높은 분산을 겪고, 비평가(critic)를 추가하면 안정성이 향상되지만 협력적 소통과 같은 과제를 해결하지 못합니다. 학습 중에 다른 에이전트의 행동을 고려하는 것은 협업 전략을 배우는 데 중요합니다.
MADDPG 알고리즘
우리는 중앙 집중식 학습과 분산 실행을 가능하게 하는 MADDPG(Multi‑Agent Deep Deterministic Policy Gradient)를 개발했습니다. 이 알고리즘은 actor‑critic 기법을 차용하여 DDPG를 확장합니다.
- 각 에이전트는 훈련 중에 어떤 행동을 강화할지 결정하기 위해 비평가의 조언을 받는 "actor"로 취급됩니다.
- 표준 RL에서 비평가는 주어진 상태에서 행동의 가치(예상 미래 보상)를 예측하고, actor는 이를 이용해 정책을 업데이트합니다.
- 다중 에이전트 학습을 가능하게 하기 위해, 우리는 비평가가 모든 에이전트의 관찰과 행동에 접근할 수 있도록 강화했습니다(다이어그램 참조).
- 테스트 시 에이전트는 중앙 비평가가 필요하지 않으며, 자신의 관찰과 다른 에이전트 행동에 대한 예측에 기반해 행동합니다.
- 중앙 비평가는 각 에이전트마다 독립적으로 학습되므로, 보상이 서로 반대되는 적대적 경우를 포함한 임의의 보상 구조를 모델링할 수 있습니다.
실험 결과
우리는 다양한 과제에서 MADDPG를 테스트했으며, 모든 과제에서 DDPG보다 우수한 성능을 보였습니다. 첨부된 애니메이션은 다음을 보여줍니다:
- 두 AI 에이전트가 특정 위치로 이동하면서, 상대 에이전트에게 의도한 위치를 숨기기 위해 흩어지는 과정.
- 한 에이전트가 다른 에이전트에게 랜드마크 이름을 전달하는 소통.
- 세 에이전트가 충돌 없이 랜드마크로 이동하기 위해 협력하는 모습.
초기 연구 과제
MADDPG 이전에 분산 기법을 사용할 때, 청취자 에이전트는 화자가 일관되지 않은 이동 명령을 보낼 경우 화자를 무시하도록 학습되는 경우가 많았습니다. 청취자는 화자의 메시지와 관련된 모든 가중치를 0으로 설정해 스스로를 청각 차단 상태로 만들었습니다. 이렇게 되면 화자는 자신의 메시지가 올바른지에 대한 피드백을 전혀 받지 못해 회복이 어려웠습니다.
우리는 최근 계층형 강화 학습 프로젝트에서 사용된 기법을 적용해 청취자가 화자의 발화를 반드시 반영하도록 강제했지만, 이는 청취자가 주의를 기울이게 할 뿐 화자가 어떤 말을 해야 할지 학습하는 데는 도움이 되지 않았습니다.
MADDPG의 중앙 비평가는 화자가 다른 에이전트의 행동에 영향을 미칠 수 있는 발화를 학습하도록 돕는 역할을 합니다.
다음 단계
에이전트 모델링은 AI 연구에서 오랜 역사를 가지고 있으며, 기존 연구는 짧은 시간 단계와 작은 상태 공간을 가진 게임에 초점을 맞추었습니다. 이제 딥러닝은 복잡한 시각 입력을 처리하고, RL은 장기간에 걸친 행동 학습 도구를 제공합니다.
MADDPG를 통해 우리는 에이전트들이 환경의 역학을 알 필요 없이 동시에 학습할 수 있게 되었으며, 이는 소통, 언어, 고차원 정보 학습을 포함한 보다 폭넓은 문제 영역을 열어줍니다.
에이전트 진화를 연구하는 분들은 OpenAI에서 제공하는 기회를 고려해 보시기 바랍니다.
저자
Ryan Lowe, Igor Mordatch, Pieter Abbeel, Yi Wu, Aviv Tamar, Jean Harb