OpenAI 계층 학습 연구
OpenAI는 Meta-Learning Shared Hierarchies(MLSH)라고 하는 계층적 강화 학습 알고리즘을 도입하여, 수천 타임스텝이 필요한 작업을 고수준 행동을 자동으로 발견하여 해결하도록 설계되었습니다. 이 접근 방식은 저수준 행동에 대한 brute-force search에 의존하는 대신 학습된 구성 요소를 시퀀싱함으로써 에이전트가 새로운 복잡한 탐색 작업을 빠르게 습득할 수 있게 합니다.
장기 과제의 도전
전통적인 강화 학습 방법은 저수준 행동에 대한 brute-force search에 자주 의존하며, 작업이 많은 타임스텝을 요구할 때 매우 비효율적이 됩니다. 예를 들어, 2,000개의 저수준 행동이 필요한 해결책은 단순 시도와 오류를 통해 계산적으로 비용이 많이 듭니다.
MLSH는 고수준 행동의 짧은 시퀀스로 복잡한 행동을 표현함으로써これを 해결합니다. 2,000단계 저수준 시퀀스를 10단계 고수준 시퀀스로 줄임으로써 에이전트는 훨씬 더 효율적으로 솔루션을 탐색할 수 있습니다.
Meta-Learning Shared Hierarchies (MLSH) 아키텍처
MLSH는 마스터 정책과 서브 정책 세트로 구성된 계층적 정책을 구현합니다. 마스터 정책은 매 $N$ 타임스텝마다 고수준 행동을 선택합니다(여기서 $N$은 200일 수 있음), 그리고 선택된 서브 정책은 그 $N$ 타임스텝 동안 실행됩니다.
MLSH의 주요 기술적 특성은 다음과 같습니다:
- Automatic Discovery: 이전의 수작업으로 설계된 계층적 정책과 달리, MLSH는 환경과의 상호작용을 통해 계층 구조를 자동으로 발견합니다.
- Meta-Learning Perspective: 이 알고리즘은 이전에 보지 못한 작업에서 훈련할 때 에이전트가 빠르게 높은 보상을 달성할 수 있게 하는 계층을 "좋은" 계층으로 정의합니다.
- Shared Sub-policies: 에이전트는 작업의 분포에서 훈련됩니다. 마스터 정책은 샘플링된 각 작업에 대해 새로 학습되지만, 서브 정책은 작업 간에 공유되어 에이전트가 범용 고수준 행동 세트를 다듬을 수 있게 합니다.
AntMaze에서의 실험 결과
알고리즘을 평가하기 위해 OpenAI 연구원들은 아홉 가지不同的 미로 분포를 탐색하는 MuJoCo Ant 로봇을 특징으로 하는 AntMaze 환경을 사용했습니다.
환경과의 상호작용을 통해 MLSH는 서로 다른 방향에서의 walking과 crawling과 같은 다양한 서브 정책 세트를 성공적으로 발견했으며, 이를 시퀀싱하여 미로 작업을 해결할 수 있었습니다. 연구원들은 이 서브 정책 세트가 에이전트가 원래 훈련받은 작업보다 더 큰 작업을 습득할 수 있게 했다고 언급했습니다.
가용성
OpenAI는 GitHub에서 MLSH 에이전트 훈련용 코드와 이러한 알고리즘의 평가에 사용된 MuJoCo 환경을 공개했습니다.
Sources
- OriginalLearning a hierarchy