OpenAI Summer Fellows 2018 최종 프로젝트
개요
OpenAI의 2018 Summer Fellows 프로그램은 인공지능의 중요한 병목 현상을 대상으로 하는 일련의 연구 프로젝트로 마무리되었습니다. 구체적으로는 강화 학습(RL) 일반화, 신경망 훈련의 확장성, 생성 모델의 표현력이었습니다.
강화 학습과 일반화
2018 fellows가 수행한 연구는 RL 에이전트의 과적합을 quantification하고 완화하여 서로 다른 환경 간에 지식을 전이할 수 있도록 하는 데 중점을 두었습니다.
CoinRun을 통한 일반화 quantification
Karl Cobbe는 새로운 환경에 대한 RL 에이전트의 일반화 정도를 측정하기 위해 설계된 절차적으로 생성된 게임인 CoinRun을 개발했습니다. 연구 결과, 에이전트는 훈련 세트에 과적합되는 경향이 있으며, 심지어 그 세트가 놀랍도록 크더라도 그렇다는 것이 밝혀졌습니다. 이러한 과적합을 줄이기 위해 Cobbe는 더 깊은 컨볼루션 아키텍처와 감독 학습 기법을 구현했는데, 여기에는 다음이 포함됩니다:
- L2 정규화
- Dropout
- 데이터 증강
- 배치 정규화
샘플 효율을 위한 사전 훈련
Josh Meier은 에이전트가 일반적으로 작업 간에 지식을 전이하는 데 어려움을 겪는 RL 전이 문제를 조사했습니다. 그는 비지도 관찰에서 큰 생성 모델을 사용하여 환경을 모델링하도록 신경망을 사전 훈련시키고, 그 후에 근접 정책 최적화(PPO)를 사용해 온-폴리 방식으로 모델을 미세 조정하면 샘플 효율이 증가하고 작업 간 전이가 개선된다는 사실을 발견했습니다. 이 접근 방식은 트랜스포머 네트워크 확장, 언어 모델 미세 조정, 그리고 PPO를 결합했습니다.
RL에서의 과적합 분석
Xingyou (Richard) Song은 강화 학습에서 발생하는 과적합의 유형을 최적화 및 합성 관점에서 모두 분석했습니다. 그의 연구는 관찰 과적합과 일반화 격차에 기여하는 최적화 환경 내의 요인에 초점을 맞췄습니다. 또한 Song은 Joshua Meier와 협력하여 Sonic The Hedgehog 환경에서 최첨단 방법을 평가하고, 왜 특정 생성 모델링 및 특수 아키텍처가 대규모 데이터셋에서 실패하는지 분석했습니다.
분산 훈련과 AI의 과학
Sam McCandlish는 분산 신경망 훈련을 위한 대규모 컴퓨팅 하드웨어의 사용을 연구했습니다. 그의 연구는 MNIST부터 Dota에 이르기까지 다양한 기계 학습 작업에서 예측 가능한 패턴을 확인했습니다. 구체적으로는 특정 점수를 달성하기 위해 필요한 경험의 양과 훈련 시간 사이의 트레이드오프가 예측 가능하다는 사실을 발견했습니다.
생성 모델과 물리 사전
생성 모델링 연구는 샘플 품질, 안정성, 그리고 모델 표현력을 벤치마크할 수 있는 능력을 향상시키는 데 중점을 두었습니다.
정규화 흐름 모델
Johannes Otterbach은 더 간단한 분포의 연속적인 변형을 통해 데이터 분포를 근사하는 정규화 흐름 모델을 연구했습니다. 그는 이러한 모델이 근사하기 inherently 어려운 인공 데이터셋을 만들어 미래 생성 모델이 유연성과 표현력을 측정할 수 있는 벤치마크를 제공했습니다.
에너지 기반 모델과 동역학 지식
이름 없는 fellow (이전 MIT 학부생)는 생성 모델링과 RL의 두 가지 주요 영역을 탐구했습니다:
- 동역학 지식 통합: fellow는 더 나은 장기 물리 예측을 위한 새로운 아키텍처를 개발했으며, 비디오와 이전 환경에서 학습한 동역학 정보를 새로운 환경으로 전이하는 방법을 탐구했습니다.
- 에너지 기반 모델(EBMs): fellow는 EBMs의 훈련을 확장하고 안정화하는 데 주력했습니다. 재생 버퍼를 구현함으로써, fellow는 EBMs가 다른 최신 우도 모델보다 더 높은 품질의 샘플을 생성할 수 있음을 발견했으며, 이는 분포 외 일반화 강도, 구성 능력, 그리고 CIFAR-10 샘플의 인페인팅 및 복원 능력을 보여주었습니다.