vipshop/cache-dit

A PyTorch-native inference engine with cache, parallelism, quantization and cpu offload for DiTs.

解決する課題

Cache-DiT は、Diffusion Transformers (DiTs) の実行を加速するために設計された PyTorch ネイティブの推論エンジンです。画像、ビデオ、オーディオ生成に使用される大規模な DiT モデルの高コストな計算量とメモリ要件に対処し、より高速な推論速度と効率的なハードウェア利用を可能にします。

仕組み

Hugging Face Diffusers ライブラリをベースに構築された Cache-DiT は、レイテンシとメモリフットプリントを削減するためにいくつかの最適化技術を採用しています:

  • ハイブリッドキャッシュ加速: 冗長な計算を避けるために、さまざまなキャッシュ戦略(DBCache、TaylorSeer、SCM、DMD など)を実装しています。
  • 並列処理: コンテキスト並列性、テンソル並列性、およびハイブリッド 2D/3D 並列性を含む幅広い並列戦略をサポートし、Text Encoders、VAEs、ControlNets を専用にサポートしています。
  • メモリ管理: 量子化(W8A8、W4A4)およびバケット形式のレイヤー単位 CPU オフロードを提供し、GPU メモリの使用を最小限に抑えます。
  • ハードウェア互換性: NVIDIA GPU、Ascend NPU、AMD GPU 上でネイティブに動作し、PyTorch コンパイルと互換性があります。

対象ユーザー

このエンジンは、プロダクション環境やハイパフォーマンスコンピューティング環境向けに推論パイプラインを最適化する必要がある、DiT ベースの生成 AI モデル(FLUX、CogVideoX、HunyuanVideo など)を扱う開発者や研究者を対象としています。

ハイライト

  • 幅広いモデルサポート: Diffusers から 40 以上の DiT パイプラインファミリーと 120 以上のバリエーションをサポートしています。
  • 大幅な高速化: キャッシュ、コンテキスト並列性、およびコンパイルの組み合わせにより、最大 9 倍の高速化を実現できます。
  • 深い統合: SGLang Diffusion、vLLM-Omni、TensorRT-LLM、ComfyUI などの人気フレームワークと完全に統合されています。
  • エージェント統合: GitHub Copilot や Claude Code のようなコーディングエージェントを使用して、ユーザーが新しい DiT パイプラインを統合できるようにするためのモデル統合 SKILL を含んでいます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch