thu-ml/DiT-Extrapolation
Official implementation for "RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers" (ICML 2025) , UltraViCo (ICLR 2026) and UltraImage
What it solves
이 프로젝트는 Diffusion Transformers (DiT)가 학습된 길이 또는 해상도를 초과하는 콘텐츠를 생성할 때 발생하는 제한 사항을 해결합니다. 구체적으로, "외삽(extrapolation)"을 가능하게 하여, 사전 학습된 모델이 대규모 재학습 없이도 더 긴 비디오(예: 5s 비디오를 11s로 확장)와 더 높은 해상도의 이미지를 생성할 수 있도록 합니다.
How it works
핵심 기술인 RIFLEx는 1D Rotary Positional Embedding (RoPE)의 특정 구성 요소의 고유 주파수를 줄여, 생성된 콘텐츠가 외삽 후에도 단일 주기 내에 머물도록 합니다. 이는 원래의 RoPE 구현에 단 한 줄의 코드를 추가함으로써 달성할 수 있으며, 플러그 앤 플레이 방식의 솔루션입니다. 또한, 이 저장소에는 비디오 및 이미지 생성의 외삽 한계를 더욱 확장하기 위한 UltraViCo 및 UltraImage 구현이 포함되어 있습니다.
Who it’s for
HunyuanVideo, CogVideoX, Wan2.1, Flux, 그리고 Qwen-Image와 같은 기존 SOTA 모델의 출력 길이 또는 해상도를 높이고자 하는 비디오 및 이미지 확산 모델 연구자 및 개발자를 대상으로 합니다.
Highlights
- Plug-and-Play: 최소한의 코드 변경으로 사전 학습된 모델에 적용할 수 있습니다.
- Temporal Extrapolation: 비디오 길이를 확장합니다 (예: HunyuanVideo를 5s에서 11s로, CogVideoX를 6s에서 12s로).
- Broad Model Support: 여러 SOTA 아키텍처를 포함하여 HunyuanVideo, CogVideoX, Wan2.1, Flux, 그리고 Qwen-Image와 호환됩니다.
- Training-Free Option: 다양한 성능 요구 사항에 따라 학습이 필요 없는 버전과 미세 조정(fine-tuned) 버전을 모두 제공합니다.