PKU-YuanGroup/ConsisID

[CVPR 2025 Highlight🔥] Identity-Preserving Text-to-Video Generation by Frequency Decomposition

What it solves

ConsisID は、テキストから動画への生成においてフレーム間で人間のアイデンティティを一貫させるという課題に取り組みます。AI 生成動画でよく見られる人物の外見が「ずれる」問題を防ぎ、クリップ全体を通して同一人物であることを保証します。

How it works

ConsisID はチューニング不要の Diffusion Transformer (DiT) ベースのモデルです。ビジョンと拡散トランスフォーマーの周波数解析に基づく周波数分解を利用し、アイデンティティを保持します。システムは人物の参照画像とテキストプロンプトを受け取り、画像のアイデンティティが動画内の被写体に一貫して適用された動画を生成します。

Who it’s for

このツールは、制御可能な動画生成に取り組むクリエイターや研究者向けで、広範なモデルのファインチューニングなしに高忠実度のアイデンティティ保持が必要な方に最適です。

Highlights

  • Tuning-Free: 新しい被写体に対して追加のトレーニングやファインチューニングを行うことなく、アイデンティティの一貫性を維持します。
  • DiT-Based: Diffusion Transformer アーキテクチャ上に構築されています。
  • Memory Optimizations: CPU オフロード、VAE スライシング、タイル処理などのオプションを含み、44GB 未満の VRAM を搭載した GPU でも動作可能です。
  • Integration: Hugging Face の diffusers ライブラリに統合されています。
  • Inference Acceleration: xDiT による並列推論と TeaCache によるキャッシュ推論をサポートします。