thu-ml/DiT-Extrapolation

Official implementation for "RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers" (ICML 2025) , UltraViCo (ICLR 2026) and UltraImage

What it solves

這項專案屬解決了 Diffusion Transformers (DiT) 在生成超出其訓練長度或解析度內容時的限制。具體而言,它實現了「外推法」(extrapolation),允許預訓練模型在不需要大量重新訓練的情況下,生成更長的影片(例如:將 5s 影片延伸至 11s)與更高解析度的圖像。

How it works

核心技術 RIFLEx 修改了 1D Rotary Positional Embedding (RoPE),透過降低特定組件的內在頻率,以確保生成的內容在經過外推後仍保持在單一週期內。這可以透過在原始 RoPE 實作中增加單行程式碼來達成,使其成為一個即插即用的解決方案。該儲存庫也包含了 UltraViCo 與 UltraImage 的實作,以進一步突破影片與圖像生成的外推限制。

Who it’s for

它是為正在開發影片與圖像擴散模型的研究人員與開發者所設計的,旨在增加現有 SOTA 模型(如 HunyuanVideo, CogVideoX, Wan2.1, Flux, 和 Qwen-Image)的輸出長度或解析度。

Highlights

  • Plug-and-Play: 可以透過極少的程式碼變動來應用於預訓練模型。
  • Temporal Extrapolation: 延伸影片長度(例如:HunyuanVideo 從 5s 延伸至 11s,CogVideoX 從 6s 延伸至 12s)。
  • Broad Model Support: 相容於多種 SOTA 架構,包括 HunyuanVideo, CogVideoX, Wan2.1, Flux, 和 Qwen-Image。
  • Training-Free Option: 為不同的效能需求提供免訓練與微調版本。