Jasonzzt/ComfyUI-CacheDiT

Cache-DiT Node for Comfyui

何を解決するか

Diffusion Transformer (DiT) モデルの生成時間を短縮することで、画像および動画の生成にかかる時間を削減します。これらのモデルの高い計算コストに対処し、通常1.4x~2.0xの高速化を実現します。複雑な設定は不要です。

仕組み

本プロジェクトは、Transformerの計算結果を知能的にキャッシュする仕組みを実装しています。初期の「ウォームアップ」フェーズで最初の数ステップを完全に計算した後、skip_interval で定義された特定の間隔で、各ステップごとに再計算するのではなく、キャッシュされた結果を再利用します。

MiniMax H3 などの特定のモデルでは、残差の差分に基づくより高度な適応的アプローチを用いて、キャッシュを再利用するタイミングを判断し、音声・動画の同時生成において品質の保持をより確実にします。

対象ユーザー

Flux.2、WAN2.2、LTX-2、MiniMax H3 などのDiTベースの画像・動画生成モデルを使用する ComfyUI ユーザーで、生成時間を短縮したい方。

特徴

  • 大幅な高速化: 複数のモデルで1.4x~2.0xの加速を達成。
  • ゼロ設定: モデルを自動検出し、最適な設定を適用する「Auto」プリセットを搭載。
  • 広範なモデル対応: Z-Image、Qwen-Image、Flux.2 Klein、MiniMax H3、LTX-2、WAN2.2 14B など、多数のモデルで検証済み。
  • 動的制御: 残差しきい値やウォームアップステップなどの詳細設定を可能にする高度なノードを提供し、特定のワークフローに最適化できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト