계층적 강화 학습을 위한 확률적 신경망

OpenAI는 확률적 신경망을 활용하여 다양한 기술을 사전 훈련하고 이를 다운스트림 작업에서의 학습 속도를 높이는 데 사용하는 계층적 강화 학습(HRL)을 위한 일반적인 프레임워크를 도입했습니다. 이 접근법은 희소 보상과 장시간 과제의 과제를 구체적으로 해결하며, 이때 전통적인 딥 강화 학습은 효과적으로 탐색하는 데 어려움을 겪는 경우가 많습니다.

확률적 신경망을 통한 사전 기술 훈련

프레임워크의 핵심은 에이전트가 사전 훈련 환경에서 유용한 기술을 배우는 사전 훈련 단계입니다. 연구자들은 해석 가능한 기술을 폭넓게 효율적으로 학습하기 위해 확률적 신경망과 정보이론적 정규화기를 결합하여 사용합니다.

이 사전 훈련 과정은 단일 프록시 보상에 의해 안내되며, 이는 에이전트가 결국 직면하게 될 특정 다운스트림 작업에 대한 도메인 지식을 최소화합니다. 정보이론적 정규화기를 사용함으로써 시스템은 학습된 기술이 서로 distinct(구별되도록) 하고 광범위한 행동을 포괄하도록 보장합니다.

계층적 학습 아키텍처

이 프레임워크는 탐색 및 샘플 효율성을 향상시키기 위해 계층적 구조에서 작동합니다:

  1. 기술 습득: 에이전트는 사전 훈련 단계 동안 확률적 신경망 아키텍처를 사용하여 기술 라이브러리를 먼저 학습합니다.
  2. 고수준 정책 훈련: 기술이 습득되면, 이러한 사전 존재하는 기술 위에 고수준 정책이 훈련됩니다. 원시 행동을 배우는 대신, 고수준 정책은 목표를 달성하기 위해 학습된 기술 중에서 선택합니다.

이 계층 구조는 고수준 정책이 무작위 원시 행동 대신 복잡하고 의미 있는 행동(기술)을 사용하여 환경을 탐색할 수 있기 때문에 에이전트가 다운스트림 작업에서의 희소 보상을 더 효과적으로 처리할 수 있게 합니다.

성능 및 함의

실험 결과, 확률적 신경망과 정보이론적 정규화기의 조합은 샘플 효율적인 방식으로 해석 가능한 기술을 학습하는 데 효과적임이 입증되었습니다. 연구자들은 이 접근법이 다양한 다운스트림 작업 전반에 걸쳐 학습 성능을 균일하게 크게 향상시킨다는 것을 발견했습니다.

내재적 동기와 계층적 방법의 강점을 결합함으로써 이 프레임워크는 새로운 작업마다 보상 함수를 광범위하게 수작업으로 설계할 필요 없이 복잡한 행동을 학습할 수 있는 확장 가능한 방법을 제공합니다.

Sources