연속 시간 일관성 모델을 단순화하고, 안정화하며, 확장하기
OpenAI는 sCM이라는 새로운 연속 시간 일관성 모델 접근 방식을 도입했으며, 이는 단 두 번의 샘플링 단계만으로 고품질 샘플을 생성할 수 있게 합니다. 이 방법은 전통적인 확산 모델에 비해 약 50배의 실제 시간 가속을 제공하면서도 비슷한 샘플 품질을 유지합니다.
sCM을 통한 가속 샘플링
sCM은 노이즈를 직접 노이즈 없는 샘플로 변환함으로써 생성 AI의 계산 오버헤드를 크게 줄입니다. 전통적인 확산 모델은 단일 이미지를 생성하기 위해 수십에서 수백 단계의 순차적인 디노이징이 필요하지만, sCM은 이 점진적인 과정을 건너뛰도록 설계되었습니다.
가장 큰 sCM 모델(15억 파라미터)의 주요 성능 지표는 다음과 같습니다:
- 샘플링 속도: 추론 최적화 없이 단일 A100 GPU에서 0.11초 만에 하나의 샘플을 생성합니다.
- 효율성: 다른 최첨단 생성 모델이 유사한 Fréchet Inception Distance (FID) 점수를 달성하기 위해 요구하는 실제 샘플링 연산량의 10% 미만을 사용합니다.
- 단계 감소: 두 번의 샘플링 단계만으로도 선도적인 확산 모델에 필적하는 품질을 달성합니다.
기술 구현 및 확장
sCM은 연속 시간 일관성 모델의 이론적 공식화를 단순화하여 학습 과정을 안정화하고, 모델이 더 큰 데이터셋과 파라미터 수로 확장될 수 있게 합니다. OpenAI는 512×512 해상도의 ImageNet에 대해 15억 파라미터 규모로 sCM 학습을 확장했습니다.
지식 증류
sCM 접근 방식은 사전 학습된 교사 확산 모델로부터 지식을 증류합니다. OpenAI의 연구에 따르면, 교사 확산 모델이 커질수록 sCM도 비례적으로 개선됩니다. 샘플 품질의 상대적 차이(FID 점수 비율)는 모델 크기가 여러 차수에 걸쳐 일관되게 유지되며, 이는 모델이 커질수록 절대적인 품질 격차가 감소함을 의미합니다.
품질 vs. 단계
샘플링 단계를 두 개 이상으로 늘리면 sCM과 교사 확산 모델 간의 품질 격차가 더욱 감소합니다. 두 단계만 사용하더라도 FID 점수의 상대적 차이는 교사 모델에 비해 10% 미만이며, 교사 모델은 일반적으로 수백 단계가 필요합니다.
제한 사항 및 제약
속도 향상에도 불구하고 sCM에는 특정 기술적 의존성 및 평가상의 어려움이 존재합니다:
- 교사 모델 의존성: 현재 가장 효과적인 sCM은 초기화와 증류를 위해 사전 학습된 확산 모델에 의존합니다.
- 품질 격차: sCM과 교사 확산 모델 사이에 작지만 일관된 샘플 품질 격차가 남아 있습니다.
- 측정 지표 한계: OpenAI는 FID 점수가 실제 인지된 샘플 품질을 항상 완벽히 반영하지는 않으며, 특정 응용 요구에 따라 sCM 품질을 다르게 평가해야 할 수 있다고 지적합니다.