OpenAI, 일관성 모델 학습을 위한 개선된 기술 발표

TL;DR

OpenAI는 일관성 모델에서 확산 모델 증류(diffusion‑model distillation)의 필요성을 제거하는 일련의 학습 개선 사항을 발표했습니다. 이를 통해 CIFAR‑10에서 2.51, ImageNet 64×64에서 3.25의 단일 단계 FID 점수를 달성했으며, 이는 이전의 일관성 학습 결과보다 약 3.5배~4배 더 나은 수치입니다.

배경: 일관성 모델과 그 한계

일관성 모델은 확산 모델의 반복적인 샘플링을 피하고 단일 추론 단계에서 데이터를 생성합니다. 역사적으로 이 모델들은 학습을 가이드하기 위해 사전 학습된 확산 모델로부터의 **증류(distillation)**와 LPIPS와 같은 학습된 지각적 지표에 의존해 왔습니다. 이러한 의존성은 최종 샘플 품질을 교사(teacher) 확산 모델의 성능으로 제한하며, LPIPS로 인한 평가 편향을 초래합니다.

데이터 직접 학습을 통한 증류 제거

OpenAI의 새로운 접근 방식은 확산 교사 모델로부터 증류하는 대신 원시 데이터에서 직접 일관성 모델을 학습시킵니다. 교사-학생 파이프라인을 제거함으로써 모델은 더 이상 확산 모델의 품질에 의해 제한되지 않으며, 이전의 일관성 모델 한계를 넘어설 수 있습니다.

이론적 결함 수정: 교사 모델에서 EMA 제거

분석 과정에서 저자들은 이전에 간과되었던 결함을 발견했습니다. 교사 일관성 모델에 적용된 **지수 이동 평균(Exponential Moving Average, EMA)**이 일관성 목적 함수를 방해한다는 점입니다. 해결책은 교사 모델에서 EMA를 제거하는 것이며, 이는 학습을 안정화하고 수렴을 개선합니다.

LPIPS를 Pseudo‑Huber Loss로 교체

LPIPS는 지각적 유사성에는 유용하지만 학습 목적 함수에 편향을 줍니다. OpenAI는 이를 Pseudo‑Huber loss로 대체했습니다. 이는 오차가 0에 가까울 때는 L2의 매끄러움을, 이상치 저항성은 L1의 특성을 결합한 강건 통계(robust-statistics) 손실 함수입니다. 이러한 변화는 더 신뢰할 수 있는 그래디언트와 더 나은 시각적 충실도를 제공합니다.

Lognormal 노이즈 스케줄 및 단계 배가

두 가지 추가적인 학습 기법이 도입되었습니다:

  1. Lognormal noise schedule – 주입되는 노이즈의 분산이 로그 정규 분포를 따르며, 이는 타임스텝 전반에 걸쳐 데이터 매니폴드의 스케일에 더 잘 부합합니다.
  2. Dynamic discretization steps – 총 이산화 단계(discretization steps) 수가 고정된 학습 반복 횟수 이후에 두 배로 늘어나, 학습이 진행됨에 따라 일관성 목적 함수의 해상도를 효과적으로 높입니다.

두 조정 사항 모두 모델이 더 세밀한 일관성 관계를 학습하는 데 도움을 줍니다.

하이퍼파라미터 튜닝 및 전반적인 이득

종합적인 하이퍼파라미터 탐색이 아키텍처 변경을 보완합니다. 결합된 효과로 인해 단일 샘플링 단계에서 **FID 점수 2.51 (CIFAR‑10) 및 3.25 (ImageNet 64×64)**를 기록했으며, 이는 이전의 일관성 학습 베이스라인 대비 3.5배 및 4배의 향상을 나타냅니다.

2단계 샘플링을 통한 품질 추가 개선

모델에 두 번째 샘플링 단계가 허용될 경우, FID 점수는 **2.24 (CIFAR‑10) 및 2.77 (ImageNet 64×64)**로 향상됩니다. 이러한 결과는 1단계 및 2단계 regime 모두에서 증류를 통해 얻은 결과를 능가하며, 일관성 모델과 광범위한 최첨단 생성 모델 클래스 간의 성능 격차를 좁힙니다.

생성 모델링에 미치는 영향

  • 효율성 – 단일 단계 샘플링은 일관성 모델의 속도 이점을 유지하면서 다단계 확산 모델에 필적하는 품질을 달성합니다.
  • 단순성 – 증류를 제거함으로써 학습 파이프라인이 단순화되어 계산 오버헤드가 줄어들고 대규모 확산 교사 모델의 필요성이 사라집니다.
  • 벤치마크 발전 – 보고된 FID 점수는 표준 이미지 합성 벤치마크에서 일관성 모델의 새로운 최첨단(state-of-the-art)을 설정합니다.

향후 방향

OpenAI의 연구 결과는 로그 정규 스케줄을 고해상도 데이터셋으로 확장하고, 대안적인 강건 손실 함수를 탐색하며, 일관성 학습을 조건부 생성 작업과 통합하는 것과 같은 추가적인 연구 방향을 제시합니다.


모든 수치와 주장은 2024-06-20자 OpenAI 발표에서 직접 가져왔습니다.

Sources