thu-ml/DiT-Extrapolation
Official implementation for "RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers" (ICML 2025) , UltraViCo (ICLR 2026) and UltraImage
What it solves
该项目解决了 Diffusion Transformers (DiT) 在生成超出其训练长度或分辨率的限制。具体而言,它实现了“外推法”(extrapolation),允许预训练模型在不需要大量重新训练的情况下,生成更长的视频(例如:将 5s 视频延长至 11s)和更高分辨率的图像。
How it works
核心技术 RIFLEx 修改了 1D Rotary Positional Embedding (RoPE),通过降低特定组件的 intrinsic 频率,通过添加一行代码到原始 RoPE 实现中,使其成为一个即插即用的解决方案。该仓库也包含了 UltraViCo 和 UltraImage 的实现,以进一步突破视频和图像生成的外推限制。
Who it’s for
它是为正在使用视频和图像扩散模型的研究人员和开发人员设计的,旨在增加现有 SOTA 模型(如 HunyuanVideo, CogVideoX, Wan2.1, Flux, 和 Qwen-Image)的输出长度 or 分辨率。
Highlights
- Plug-and-Play: 可以通过极少的代码更改来应用于预训练模型。
- Temporal Extrapolation: 延长视频长度(例如:HunyuanVideo 从 5s 延长至 11s,CogVideoX 从 6s 延长至 12s)。
- Broad Model Support: 兼容多种 SOTA 架构,包括 HunyuanVideo, CogVideoX, Wan2.1, Flux, 和 Qwen-Image。
- Training-Free Option: 提供针对不同性能需求的不同版本(免训练和微调版本)。