NVlabs/rcm

rCM & Causal-rCM: Leading and Unified Algorithms/Infrastructures for Bidirectional/Autoregressive Video Diffusion Distillation at Scale

해결하는 문제

rCM는 소수의 스텝에서 동영상을 생성할 때 발생하는 품질과 다양성의 한계를 해결합니다. 특히 기존의 연속 시간 일관성 증류 방법(sCM 등)의 한계를 극복하기 위해, 오프라인 전방 발산(forward-divergence)과 온폴리시(On-policy) 역KL(reverse-KL) 증류 프레임워크를 결합하여 높은 시각적 품질을 유지하면서 원래의 교사 모델의 다양성을 보존합니다.

작동 방식

이 프로젝트는 스코어 정규화된 연속 시간 일관성 모델을 구현합니다. 일관성 모델(CM)과 확산 모델 증류(DMD)를 보완하는 공동 증류 프레임워크를 사용하여 단 2~4단계의 샘플링으로 고품질의 동영상을 생성할 수 있습니다.

스트리밍 동영상 및 인터랙티브 월드 모델을 위해, Causal-rCM을 도입합니다. 이는 교사 강제(전방 발산)와 자기 강제(역방향 발산) 학습 스택을 통합하여 자기 회귀적 동영상 확산 증류를 지원합니다.

대상 사용자

동영상 확산 모델을 연구 및 개발하는 AI 연구자 및 엔지니어. 특히 10B+ 파라미터의 대규모 모델로 증류를 확장하거나, 스트리밍 동영상 생성 및 인터랙티브 월드 모델 개발을 고려하는 사람들을 위한 것입니다.

주요 특징

  • 소수 단계 생성: 1~4단계에서 고품질이고 다양한 동영상을 생성 가능.
  • 확장 가능한 인프라: FSDP2, Ulysses Context Parallel(CP), Selective Activation Checkpointing(SAC)를 활용하여 10B+ 파라미터 모델까지 확장 가능.
  • 사용자 정의 커널: 오픈소스로 제공되는 FlashAttention-2 자코비안-벡터 곱(JVP) 커널 포함.
  • 인과 확장: 양자화된 KV 캐시와 길이 외삽을 최적화한 인과 추론을 포함한 자기 회귀 학습을 위한 통합 레시피 제공.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트