OpenAI와 옥스퍼드가 다중 에이전트 강화 학습을 위한 LOLA를 소개합니다
OpenAI와 옥스퍼드 대학교는 상대방 학습 인식(LOLA)을 도입했는데, 이는 에이전트가 자신의 전략을 업데이트할 때 다른 에이전트의 학습 과정을 고려할 수 있게 하는 강화 학습(RL) 프레임워크입니다. 이 접근 방식은 경쟁적 또는 협력적 게임에서 에이전트가 상호적인 전략을 발견하도록 enabling하며, 표준 딥 RL 방법의 한계를 극복하는데, 이는 종종 이기적이고 비최적의 결과를 초래합니다.
강화 학습에서의 마인드 이론
LOLA은 마인드 이론의 한 형태를 구현하여, 에이전트가 자신의 행동이 다른 에이전트의 미래 행동에 어떻게 영향을 미치는지를 추론할 수 있게 합니다. 전통적인 딥 멀티에이전트 강화 학습에서는 에이전트가 다른 학습 에이전트를 환경의 정적인 부분—나무나 벽과 유사하게—취급하며, 다른 에이전트도 정책을 적응시키고 있다는 사실을 무시합니다. LOLA은 다른 에이전트(예: "Bob))의 매개변수 업데이트가 자신의 정책(예: "Alice))에 어떻게 의존하는지를 모델링함으로써 자신을 차별화합니다. 이 관계를 이해함으로써 Alice는 자신의 목표에 더 유리하도록 Bob의 학습 단계를 형성할 수 있도록 자신의 정책을 업데이트할 수 있습니다.
기술적 구현 및 성능
LOLA의 성능 핵심은 정책 업데이트 과정에 특정 수학 항을 포함하는 것입니다:
$$ \left(\left(\frac{\partial V^{1} (\theta_{i}^{1} , \theta_{i}^{2})}{\partial \theta_{i}^{2}}\right)^{T} \frac{\partial^{2} V^{2} (\theta_{i}^{1} , \theta_{i}^{2})}{\partial \theta_{i}^{1} \partial \theta_{i}^{2}} \cdot \delta \eta\right) $$
이 항은 에이전트가 다른 에이전트의 학습 경로를 명시적으로 고려할 수 있게 합니다. 이 메커니즘은 state-of-the-art 딥 RL 방법(예: Independent PPO)이 실패하는 환경에서도 LOLA 에이전트가 성공할 수 있게 합니다. Independent PPO 에이전트는 일반적으로 다른 에이전트의 목표를 무시하는 이기적인 행동을 배우지만, LOLA 에이전트는 수작업으로 만든 규칙이나 사전 설정된 협력 환경 없이도 다른 에이전트의 목표를 incorporated한 자기 이익에 따라 행동합니다.
코인 게임과 죄수의 딜레마에서의 응용
LOLA 에이전트는 반복된 죄수의 딜레마와 코인 게임과 같은 복잡한 상황에서 효과적이고 상호적인 전략을 발견할 수 있음을 보여주었습니다.
코인 게임에서 두 에이전트(빨간색과 파란색)는 코인을 주우기 위해 경쟁합니다. 어떤 코인이든 1점을 제공하지만, 반대 색상의 코인을 주우면 에이전트에게 -2점의 패널티가 부과됩니다. 에이전트가 모든 코인을 주우며 탐욕적으로 행동하면 평균 점수는 0이 됩니다. 그러나 LOLA 에이전트는 주로 자신의 색상의 코인을 주우도록 학습하여, 다른 에이전트의 행동을 협력 방향으로 형성함으로써 양측 모두 높은 점수를 얻습니다.
Sources
- OriginalLearning to model other minds
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch