MeiGen-AI/OPSD-V
On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators
해결하는 문제
OPSD-V는 소수 단계의 자기회귀(AR) 동영상 생성 모델에서 발생하는 오차 누적과 약화된 운동 동역학 문제를 해결합니다. 이러한 모델에서는 하나의 생성 청크 내에서 발생하는 작은 아티팩트나 의미적 드리프트가 KV 캐시에 다시 기록되며, 이는 이후 모든 청크의 품질을 저하시켜 장기적인 시각적 품질이 나빠집니다.
작동 방식
후처리를 위한 온폴리시(On-policy) 자기증류 파라다임을 사용합니다. "학생" 모델은 실제 배포 로울아웃과 정확히 동일한 방식으로 청크를 생성하고 자신의 KV 캐시를 업데이트합니다. 반면, "교사" 모델은 동일한 노이즈 제거 상태에서 평가됩니다. 그러나 교사는 실제 장시간 동영상 컨텍스트에서 구성된 더 깨끗하고 AR 일관성 있는 시계열 캐시를 제공받습니다. 학생 모델의 속도 예측을 교사 모델과 일치시키는 방식으로, 원래의 소수 단계 샘플러나 추론 시 캐시 메커니즘을 변경하지 않고도 안정성을 향상시키는 밀도 높은 보정 타겟을 모델이 얻게 됩니다.
대상 사용자
특히 소수 단계 확산 모델의 장기적 안정성과 운동 품질을 개선하고자 하는 자기회귀 동영상 생성에 종사하는 연구자 및 개발자.
주요 특징
- 온폴리시 학생 로울아웃: 학생 모델은 실제 추론을 모방하기 위해 훈련 중에도 자신의 생성된 KV 캐시를 유지합니다.
- 깨끗한 교사 컨텍스트: 실제 동영상 기록을 사용하여 교사 모델에 고품질 참조를 제공합니다.
- 원래 추론 경로 유지: 원래의 4단계 AR 샘플러를 유지하여 배포 시 지연 시간 증가 없이 운영 가능합니다.
- 메모리 효율적인 훈련: 청크 단위 역전파, FSDP, LoRA/EMA 지원을 통해 장시간 동영상 훈련을 가능하게 합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트