OpenAI 온라인 계획 오프라인 학습 (POLO) 프레임워크

OpenAI는 내부 모델을 가진 에이전트가 환경 내에서 지속적으로 행동하고 학습할 수 있도록 하는 방법인 Plan Online Learn Offline (POLO) 프레임워크를 소개했습니다. 이 프레임워크는 로컬 궤적 최적화와 글로벌 가치 함수 학습 간의 시너지 관계를 형성함으로써 복잡한 제어 작업에서 학습 효율성과 탐색 안정성을 높이도록 설계되었습니다.

시너지 모델 기반 제어와 가치 학습

POLO 프레임워크는 로컬 모델 기반 제어와 글로벌 가치 함수 학습이 서로를 강화하여 각각의 한계를 극복할 수 있다는 원칙에 따라 작동합니다.

로컬 궤적 최적화

로컬 궤적 최적화는 에이전트가 글로벌 가치 함수의 근사 오차에 대처할 수 있게 합니다. 로컬로 계획함으로써 에이전트는 가치 함수의 학습 과정을 안정화하고 가속화할 수 있습니다.

글로벌 가치 함수 학습

근사 가치 함수는 에이전트가 계획 수평을 줄이는 데 도움이 되는 글로벌 관점을 제공합니다. 수평이 감소하면 에이전트는 단순한 로컬 솔루션을 넘어서는 정책을 발견하고 구현할 수 있습니다.

시간적으로 조정된 탐색

복잡한 환경에서 효율적인 학습을 위해서는 에이전트가 상태 공간을 효과적으로 탐색해야 합니다. POLO는 궤적 최적화를 활용하여 시간적으로 조정된 탐색을 수행합니다.

이 탐색 전략은 궤적 최적화와 가치 함수 근사의 불확실성 추정을 결합함으로써 구현됩니다. 이러한 조정된 접근 방식은 가치 함수의 빠르고 안정적인 학습에 필수적입니다.

복잡한 제어 작업에서의 성능

POLO 프레임워크는 높은 샘플 효율성으로 복잡한 시뮬레이션 제어 작업을 해결할 수 있게 합니다. 구체적으로, 이 프레임워크는 다음에 적용되었습니다:

  • Humanoid Locomotion: 시뮬레이션된 인간형 로봇이 걸을 수 있도록 함.
  • Dexterous In-Hand Manipulation: 시뮬레이션된 손 안에서 복잡한 물체 조작을 관리.

OpenAI에 따르면, 이러한 작업들은 실제 세계에서 몇 분에 해당하는 경험만으로 해결되었습니다.

Sources