OpenAI 연구 요청 2.0
OpenAI는 내부 연구에서 파생된 일곱 가지 미해결 문제로 구성된 Requests for Research 2.0을 발표했습니다. 이 이니셔티브는 강화 학습(RL), 생성 모델, 자동 추론 분야에서 구체적이고 높은 영향력을 가진 기술적 과제를 제공함으로써 더 넓은 연구 커뮤니티의 참여를 유도하는 것을 목표로 합니다.
강화 학습 과제
OpenAI는 강화 학습 에이전트의 안정성과 효율성을 향상시키는 데 초점을 맞춘 여러 가지 과제를 제시합니다.
멀티플레이어 게임 환경 (Slitherin’)
연구자들은 클래식 스네이크 게임의 멀티플레이어 클론을 Gym 환경으로 구현하는 임무를 맡았습니다. 목표는 셀프 플레이와 RL 알고리즘을 사용하여 에이전트를 개발하고 환경을 해결하는 것입니다. 주요 기술적 과제는 다음과 같습니다:
- 환경 설계: 과일을 먹으며 성장하고 벽, 다른 뱀, 또는 자신과 충돌 시 죽는 여러 마리의 뱀이 있는 큰 필드를 만드는 것.
- 셀프 플레이 불안정성: 과거 정책의 분포에 대해 정책을 훈련시켜 실험함으로써 셀프 플레이와 자주 연관된 불안정성(GAN 불안정성과 유사)을 극복하는 것.
- 행동 분석: 에이전트가 공격, 함정 설치, 경쟁자와의 연합과 같은 복잡한 전략을 배우는지를 판단하는 것.
분산 RL에서의 파라미터 평균화
이 요청은 분산 RL 알고리즘의 샘플 복잡성과 통신 오버헤드에 초점을 맞춥니다. OpenAI는 작업자를 독립적으로 업데이트하고 파라미터를 드물게 평균화하여 통신 대역폭을 줄이는 파라미터 평균화 방안을 탐색할 것을 제안합니다. 잠재적인 이점에는 다음이 포함됩니다:
- 향상된 탐색: 서로 다른 파라미터를 가진 에이전트는 더 나은 탐색 행동을 보일 수 있습니다.
- 샘플 복잡성: EASGD와 같은 알고리즘을 포함한 다양한 평균화 방식이 전체 학습 효율에 미치는 영향을 조사합니다.
생성 모델 및 아키텍처
OpenAI는 Transformer 기반 모델의 효율성과 전이 가능성에 대한 연구를 제안합니다.
생성 모델을 통한 전이 학습
이 과제는 다양한 작업에 대한 사전 훈련이 새로운 작업에서의 성능을 향상시킬 수 있는지 탐구합니다. 제안된 방법론은 다음과 같습니다:
- 11개의 Atari 게임에 대한 정책 훈련.
- 10개의 게임에서의 궤적에서 생성 모델(예: Transformer)을 fitting.
- 11번째 게임에서 모델을 fine-tuning하여 사전 훈련의 이점을 정량화.
- 11번째 게임에 대한 모델 크기와 사용 가능한 데이터 양이 전이 학습 이점에 미치는 영향을 분석.
선형 어텐션을 갖춘 Transformer
OpenAI는 Transformer의 소프트맥스 어텐션 메커니즘을 선형 어텐션으로 대체하는 방법을 찾고자 합니다.これにより Transformer를 빠른 가중치를 가진 RNN으로 변환하여 큰 컨텍스트에서의 RL 롤아웃을 가능하게 할 수 있습니다. 구체적인 목표는 선형 어텐션 Transformer를 사용하여 언어 모델링 작업에서 문자/단어당 비트 수를 크게 증가시키지 않고 동일하게 달성하는 것입니다. OpenAI는これが 더 높은 차원의 키/값 벡터가 필요할 수 있다고 언급합니다.
자동 추론
OpenAI는 올림피아드 부등식 문제에 대한 자동화된 솔루션을 개발하도록 커뮤니티에 도전하고 있습니다. 이러한 문제는 표현하기는 간단하지만 해결하기 위해서는 교묘한 조작이 필요한 특징을 가지고 있습니다. 목표는 이러한 문제들의 데이터셋을 구축하고, 학습된 정책을 사용하여 솔루션 탐색 중 분기 요인을 줄임으로써 많은 부분을 해결할 수 있는 프로그램을 만드는 것입니다.
starter 문제 (워밍업)
연구자들이 시작할 수 있도록 도와주기 위해 OpenAI는 두 개의 해결된 starter 문제를 제공했습니다:
- LSTM XOR 문제: 바이너리 시퀀스의 패리티를 결정하기 위해 LSTM을 훈련시키고, 고정 길이와 가변 길이 바이너리 문자열 간의 성능 차이를 테스트합니다.
- Snake Gym 환경: 기본 스네이크 게임을 Gym 환경으로 구현하고 강화 학습 알고리즘으로 해결합니다.
Sources
- OriginalRequests for Research 2.0
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch