thu-ml/DiT-Extrapolation

Official implementation for "RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers" (ICML 2025) , UltraViCo (ICLR 2026) and UltraImage

What it solves

このプロジェクトは、Diffusion Transformers (DiT) が学習済みの長さや解像度を超えてコンテンツを生成する際の制限を解決します。具体的には、「外推 (extrapolation)」を可能にし、学習済みモデルが大量の再学習なしで、より長い動画(例:5秒の動画を11秒に延長)や高解像度の画像を生成できるようにします。

How it works

コア技術である RIFLEx は、1D Rotary Positional Embedding (RoPE) を修正し、特定のコンポーネントの固有周波数を低減させることで、生成されるコンテンツが外推後も単一の周期内に収まるようにします。これは、元の RoPE 実装に 1 行のコードを追加するだけで実現可能であり、プラグアンドプレイ・ソリューションとして機能します。また、リポジトリには、動画および画像生成における外推の限界をさらに打破するための UltraViCo および UltraImage の実装も含まれています。

Who it’s for

既存の SOTA モデル(HunyuanVideo, CogVideoX, Wan2.1, Flux, および Qwen-Image)の出力長や解像度を向上させたい、動画および画像拡散モデルを扱う研究者や開発者向けに設計されています。

Highlights

  • Plug-and-Play: 最小限のコード変更で学習済みモデルに適用可能です。
  • Temporal Extrapolation: 動画の長さを延長します(例:HunyuanVideo を 5秒から 11秒へ、CogVideoX を 6秒から 12秒へ)。
  • Broad Model Support: 複数の SOTA アーキテクチャと互換性があります(HunyuanVideo, CogVideoX, Wan2.1, Flux, および Qwen-Image)。
  • Training-Free Option: さまざまなパフォーマンス要件に応じて、学習なし (training-free) 版とファインチューニング版の両方を提供します。