OpenAI 변분 옵션 발견 알고리즘
OpenAI는 변분 추론에 기반한 옵션 발견을 위한 새로운 방법을 소개했으며, 특히 변분 자동인코딩 옵션 학습(VALOR) 알고리즘과 다양한 행동 모드의 발견을 향상시키기 위한 커리큘럼 학습 전략을 제안합니다.
변분 자동인코딩 옵션 학습(VALOR)
VALOR는 변분 옵션 발견과 변분 자동인코더(VAE) 사이의 밀접한 연결에서 파생된 강화 학습 방법입니다. 이 프레임워크에서 에이전트의 정책은 노이즈 분포에서 컨텍스트를 특정 궤적으로 매핑하는 인코더 역할을 합니다. 반대로 디코더는 에이전트가 생성한 전체 궤적으로부터 원래의 컨텍스트를 복원하도록 설계되었습니다.
옵션 안정성을 위한 커리큘럼 학습
변분 옵션 발견에서 훈련 불안정을 해결하기 위해 OpenAI는 커리큘럼 학습 접근법을 제안합니다. 에이전트가 현재 컨텍스트 집합에서 충분히 강한 성능을 보일 때만 디코더에 의해 측정된 성능을 기준으로 에이전트가 노출되는 컨텍스트 수가 증가합니다.
이 커리큘럼 기반 접근법은 두 가지 주요 이점을 제공합니다:
- 훈련 안정화: VALOR 및 기타 기존 변분 옵션 발견 방법들의 훈련 과정을 안정화합니다.
- 행동 다양성 증가: 고정된 컨텍스트 분포를 사용할 때보다 단일 에이전트가 훨씬 더 많은 행동 모드를 학습할 수 있게 합니다.
연구 범위
주요 알고리즘 기여 외에도, 이 연구는 일반 변분 옵션 발견 접근법의 근본적인 한계를 조사하고 학습된 옵션이 하위 작업에 어떻게 적용될 수 있는지 검토합니다.