PKU-YuanGroup/ConsisID

[CVPR 2025 Highlight🔥] Identity-Preserving Text-to-Video Generation by Frequency Decomposition

What it solves

ConsisID 解決了文字生成影片時跨幀保持一致的人類身份的挑戰。它防止了 AI 生成影片中常見的人物外觀「漂移」問題,確保整段影片中的主體始終是同一個人。

How it works

ConsisID 是一個無需調校的 Diffusion Transformer(DiT)模型。它利用頻率分解,借鑑視覺與擴散 Transformer 的頻率分析,以保持身份一致性。系統接受人物的參考圖像與文字提示,生成的影片會將圖像中的身份一致地套用到影片中的主體上。

Who it’s for

此工具針對需要可控影片生成的創作者與研究者,協助他們在不進行大量模型微調的情況下實現高保真度的身份保持。

Highlights

  • Tuning-Free:無需為新主體進行額外訓練或微調,即可保持身份一致性。
  • DiT-Based:基於 Diffusion Transformer 架構構建。
  • Memory Optimizations:包括 CPU 卸載、VAE 切片與平鋪等選項,使模型能在顯存低於 44GB 的 GPU 上運行。
  • Integration:已整合至 Hugging Face diffusers 套件中。
  • Inference Acceleration:支援透過 xDiT 並行推論以及透過 TeaCache 快取推論。