Image GPT
OpenAI는 GPT-2의 transformer architecture를 픽셀 시퀀스에 적용한 모델인 Image GPT (iGPT)를 소개했습니다. 이 연구는 다음 픽셀 예측(next-pixel prediction)을 위해 학습된 대규모 transformer가 일관성 있는 이미지 샘플을 생성할 수 있으며, 최상위 비지도 학습 convolutional neural networks와 경쟁할 수 있는 시각적 특징을 학습할 수 있음을 보여줌으로써, 도메인 특화된 architectural priors를 계산 규모로 대체할 수 있음을 증명합니다.
Generative Pre-training from Pixels
iGPT는 이미지를 1차원 픽셀 시퀀스로 취급하며, GPT-2에서 자연어에 사용된 것과 동일한 도메인 불가지론적(domain-agnostic) transformer architecture를 적용합니다. 모델이 시퀀스 내의 다음 픽셀을 예측하도록 학습함으로써, iGPT는 인간이 제공한 라벨 없이도 객체의 외형이나 카테고리와 같은 2차원 이미지 특성을 이해하는 법을 배웁니다.
긴 시퀀스에 대한 조밀한 attention 메커니즘의 계산 비용을 관리하기 위해, OpenAI는 다음과 같은 접근 방식을 사용했습니다:
- Low Resolution: 32x32, 48x48, 64x64 해상도로 학습이 진행되었습니다.
- Custom Color Palette: 픽셀을 표현하기 위해 9-bit color palette를 생성하여, 색상 충실도를 유지하면서 표준 RGB palette와 비교하여 입력 시퀀스 길이를 3배 줄였습니다.
- Model Scales: iGPT-S (76M parameters), iGPT-M (455M), iGPT-L (1.4B), iGPT-XL (6.8B)의 네 가지 버전이 학습되었습니다.
Correlation Between Generation and Classification
이 연구는 모델의 생성 성능과 이미지 분류 성능 사이의 직접적인 연결 고리를 확립합니다. OpenAI는 모델의 규모가 커지고 학습 반복이 계속됨에 따라 생성 품질이 향상되었으며, 이는 다운스트림 작업(downstream tasks)을 위한 더 높은 특징 품질로 직접 이어졌음을 발견했습니다.
Feature Extraction and Depth
특징 추출 품질은 네트워크 전체에 걸쳐 균일하지 않습니다. OpenAI는 이미지 분류를 위한 최적의 특징이 최종 레이어보다는 네트워크의 중간 단계에 위치한다는 것을 관찰했습니다. 이는 다음과 같은 2단계 동작을 시사합니다:
- Contextualization: 모델이 주변 픽셀로부터 정보를 수집하여 문맥화된 이미지 특징을 구축합니다.
- Prediction: 모델이 해당 특징을 사용하여 조건부 다음 픽셀 예측 작업을 수행합니다.
Experimental Results and Benchmarks
iGPT는 여러 데이터셋에 대해 linear probes (학습된 특징에 대한 logistic regression) 및 전체 fine-tuning을 사용하여 평가되었습니다.
Unsupervised Performance
여러 데이터셋에서 iGPT-L (32x32)은 linear probes를 사용했을 때 다른 지도 학습 및 비지도 학습 전이 알고리즘보다 뛰어난 성능을 보였습니다:
- CIFAR-10: 96.3% 정확도 (SimCLR와 비교 시 95.3%).
- CIFAR-100: 82.8% 정확도 (SimCLR와 비교 시 80.2%).
- STL-10: 95.5% 정확도 (AMDIM와 비교 시 94.2%).
ImageNet에서 iGPT-XL (64x64)은 5개 레이어의 15,360개 특징을 사용하여 72.0% top-1 정확도를 달성했으며, 이는 AMDIM, MoCo, 그리고 CPC v2를 능가하는 수치치지만, SimCLR의 76.5%에는 미치지 못했습니다.
Comparison with BERT-style Pre-training
OpenAI는 BERT와 유사한 masked-pixel 접근 방식을 테스트했습니다 (픽셀의 15%를 마스킹). BERT-style 모델은 linear probes에서는 성능이 현저히 낮았지만, 전체 fine-tuning 과정에서는 생성 모델과 경쟁할 수 있는 수준이었습니다.
Semi-Supervised Learning
증강(augmentation)되지 않은 이미지에 대해 간단한 linear probe를 사용했을 때, iGPT-L은 데이터가 적은 CIFAR-10 환경에서 Mean Teacher와 MixMatch를 능가하였으나, FixMatch의 성능에는 미치지 못했습니다.
Limitations and Computational Costs
성능에도 불구하고, iGPT는 도메인 특화된 priors가 부족하기 때문에 상당한 실무적 한계가 있습니다:
- Compute Intensity: iGPT-L은 약 2,500 V100-days의 학습이 필요했으나, SimCLR와 유사한 성능을 내는 MoCo 모델은 약 70 V100-days가 필요합니다.
- Resolution Constraints: convolutional encoder 대신 transformer를 사용하기 때문에, iGPT iGPT는 저해상도 입력에 제한됩니다. 더 높은 해상도를 위해 확장하려면 multiscale transformer와 같은 새로운 아키텍처가 필요할 것입니다.
- Algorithmic Bias: 생성 모델로서, iGPT는 학습 데이터에 존재하는 편향을 상속받거나 증폭할 수 있으며, 이는 잠재적으로 불공정하거나 비대표적인 이미지 완성을 유과할 수 있습니다.
Conclusion
iGPT는 대규모 시퀀스 transformer가 수로운 도메인에서 수로운 architectural knowledge 없이도 우수한 비지도 학습 표현을 학습할 수 있다는 개념 증명(proof-of-concept) 개념 증명(proof-of-concept)을 수행합니다. 2차원 공간적 priors를 계산 규모로 대체함으로써, iGPT는 GPT 아키텍처의 단순성과 일반성을 언어에서 시각 분야로 효과적으로 확장할 수 있음을 보여줍니다.
Sources
- OriginalImage GPT