OpenAI 생성 모델 연구 개요
OpenAI는 생성 모델—대규모 훈련 세트와 유사한 데이터를 생성하도록 신경망을 훈련하는 비지도 학습 기법—을 활용하여 컴퓨터에 물리적 및 디지털 세계에 대한 기본적인 이해를 부여하고 있습니다. 모델이 vast amounts of data를 더 작은 수의 매개변수로 압축하도록 강제함으로써, 네트워크는 데이터를 성공적으로 재생하기 위해 데이터의 필수 특징을 발견하고 내재화해야 합니다.
생성 모델링의 핵심 접근법
생성 모델링은 모델의 분포를 데이터 세트의 실제 데이터 분포와 일치시키는 것을 목표로 합니다. OpenAI는 이를 달성하기 위한 세 가지 주요 기술적 접근법을 식별합니다:
- Generative Adversarial Networks (GANs): 두 네트워크 간의 경쟁 게임을 사용합니다. 생성기는 샘플을 만들고, 판별기는それを 실제인지 가짜인지 분류하려고 시도합니다. 생성기는 반복적으로 개선되어 실제 데이터와 구별할 수 없는 샘플을 만듭니다.
- Variational Autoencoders (VAEs): 확률적 그래픽 모델을 사용하여 데이터의 로그 우도의 하한을 최대화함으로써 효율적인 베이지안 추론을 가능하게 합니다.
- Autoregressive Models (e.g., PixelRNN): 이전 픽셀(왼쪽 및 위)을 기반으로 개별 픽셀의 조건부 분포를 모델링하여, 이미지 생성을 텍스트의 시퀀스 생성과 유사하게 취급합니다.
모델 유형 간의 트레이드오프
| 모델 유형 | 강점 | 약점 |
|---|---|---|
| GANs | 가장 선명한 이미지를 생성하고 가치 있는 텍스처 코드를 학습합니다. | 최적화가 어렵고 훈련 동역학이 불안정합니다. |
| VAEs | 복잡한 모델에서 효율적인 베이지안 추론을 지원합니다. | 생성된 샘플은 흐릿해지는 경향이 있습니다. |
| PixelRNNs | 간단하고 안정적인 훈련; 최고의 로그 우도. | 샘플링이 비효율적이며 간단한 저차원 코드가 부족합니다. |
주요 연구 기여
OpenAI는 생성 모델링과 그 강화 학습(RL) 적용에서의 최첨단 기술을 발전시키는 다섯 가지 프로젝트를 발표했습니다.
GAN 안정성 향상 및 반지도 학습
GANs의 불안정성과 '붕괴' 경향을 해결하기 위해, OpenAI는 훈련을 안정화하는 기술을 도입하여 $128 imes128$ ImageNet 샘플 생성을 가능하게 했습니다.
또한, OpenAI는 판별기가 입력에 레이블을 제공하는 반지도 학습 접근법을 개발했습니다. 이를 통해 매우 적은 수의 레이블이 있는 예시로도 높은 정확도를 달성할 수 있는데, 예를 들어 클래스당 10개의 레이블이 있는 예시만으로 MNIST에서 99.14% 정확도를 달성할 수 있습니다.
역자동회귀 흐름(IAF)을 통한 VAE 개선
잠재 변수가 독립적인 근사 사후 분포의 한계를 극복하기 위해, OpenAI는 Inverse Autoregressive Flow (IAF) 를 도입했습니다. 이 방법은 풍부한 근사 사후 분포의 계산을 병렬화하여 이전의 순차적 의존 방법보다 더 유연하고 계산적으로 확장 가능하게 만듭니다.
InfoGAN: 비지도 분리된 표현
InfoGAN은 추가적인 감독 없이 이미지의 해석 가능하고 분리된 표현을 학습하는 GAN의 확장입니다. 표현 변수의 작은 하위 집합과 관측치 사이의 상호 정보를 최대화함으로써, 모델은 카메라 각도, 조명, 또는 3D 얼굴의 얼굴 변동과 같은 두드러진 특징을 명시적으로 알려주지 않아도 자동으로 발견할 수 있습니다.
강화 학습에서의 생성 모델
OpenAI는 두 가지 특정 RL 과제에 생성 구성 요소를 적용했습니다:
- VIME (Curiosity-driven Exploration): VIME는 생성 모델의 불확실성을 활용하여 에이전트를 자기 동기화시켜 '놀라운' 상태-행동을 찾도록 합니다. 이는 보상이 희소한 고차원 공간에서 정책 탐색을 개선하는데, 예를 들어 locomotion primitives 학습과 같은 경우입니다.
- Generative Adversarial Imitation Learning: 이 접근법은 GAN 기반 프레임워크를 사용하여 전문가 시연에서 정책을 직접 추출합니다.これにより 복잡한 보상 함수를 수동으로 설계할 필요가 없어지며, Ant 및 Humanoid와 같은 어려운 OpenAI Gym 환경에서도 정책 학습이 가능해집니다.
미래 시사점
생성 모델과 데이터 세트의 확장은 완전히 그럴듯한 이미지와 비디오의 생성을 이끌 것으로 예상됩니다. 온디맨드 아트나 고급 이미지 편집과 같은 창의적 응용을 넘어, 이러한 모델은 이미지 디노이징, 인페인팅, 초해상도, 신경망 사전 훈련과 같은 기술적 작업에 필수적입니다. 궁극적으로, 훈련 과정은 컴퓨터에 세계의 구성에 대한 구조적 이해를 제공하는 것이 목표.
Sources
- OriginalGenerative models