dc-ai-projects/DC-Gen

DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space

何を解決するか

DC-Genは、現代の視覚的拡散モデルの高い計算コストと低スループットという課題に対処します。これにより、高解像度(例:4K)の画像や動画生成が、トレーニングおよび推論時間の観点から非常に高コストになることが多くなります。

仕組み

DC-Genは、事前に訓練された拡散モデルを極めて圧縮された潜在空間に移行する加速フレームワークです。埋め込み整合(Embedding Alignment) と呼ばれる技術を用いて、ベースモデルの知識を新しい潜在空間に移行し、拡散モデルの重みを再トレーニングせずに正しい意味論を持つ視覚コンテンツを生成できるようにします。その後、エンドツーエンドの微調整またはLoRA微調整を数ステップ行うことで、完全な品質を回復します。

対象ユーザー

拡散モデルを扱う開発者や研究者で、推論の大幅な高速化と、元のベースモデルの巨大なオーバーヘッドなしに高解像度の画像や動画を生成できる能力が必要な方々。

主な特徴

  • 劇的な高速化: H100 GPU上で、FLUX.1-Kreaなどのモデルに対して4K解像度で最大53.8倍の高速推論を実現。
  • 多様な応用: テキストから画像(1Kおよび4K)、テキストから動画、画像から動画、および指示ベースの画像編集をサポート。
  • 効率的な適応: モデル全体の再トレーニングを必要とせずに、自動符号化器の迅速な適応を可能に。
  • 高品質: ベースモデルの現実性とテキストレンダリング能力を維持しつつ、トークンの冗長性を大幅に削減。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト