thu-ml/DiT-Extrapolation

Official implementation for "RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers" (ICML 2025) , UltraViCo (ICLR 2026) and UltraImage

What it solves

该项目解决了 Diffusion Transformers (DiT) 在生成超出其训练长度或分辨率的限制。具体而言,它实现了“外推法”(extrapolation),允许预训练模型在不需要大量重新训练的情况下,生成更长的视频(例如:将 5s 视频延长至 11s)和更高分辨率的图像。

How it works

核心技术 RIFLEx 修改了 1D Rotary Positional Embedding (RoPE),通过降低特定组件的 intrinsic 频率,通过添加一行代码到原始 RoPE 实现中,使其成为一个即插即用的解决方案。该仓库也包含了 UltraViCo 和 UltraImage 的实现,以进一步突破视频和图像生成的外推限制。

Who it’s for

它是为正在使用视频和图像扩散模型的研究人员和开发人员设计的,旨在增加现有 SOTA 模型(如 HunyuanVideo, CogVideoX, Wan2.1, Flux, 和 Qwen-Image)的输出长度 or 分辨率。

Highlights

  • Plug-and-Play: 可以通过极少的代码更改来应用于预训练模型。
  • Temporal Extrapolation: 延长视频长度(例如:HunyuanVideo 从 5s 延长至 11s,CogVideoX 从 6s 延长至 12s)。
  • Broad Model Support: 兼容多种 SOTA 架构,包括 HunyuanVideo, CogVideoX, Wan2.1, Flux, 和 Qwen-Image。
  • Training-Free Option: 提供针对不同性能需求的不同版本(免训练和微调版本)。