PKU-YuanGroup/ConsisID
[CVPR 2025 Highlight🔥] Identity-Preserving Text-to-Video Generation by Frequency Decomposition
What it solves
ConsisID 解決了文字生成影片時跨幀保持一致的人類身份的挑戰。它防止了 AI 生成影片中常見的人物外觀「漂移」問題,確保整段影片中的主體始終是同一個人。
How it works
ConsisID 是一個無需調校的 Diffusion Transformer(DiT)模型。它利用頻率分解,借鑑視覺與擴散 Transformer 的頻率分析,以保持身份一致性。系統接受人物的參考圖像與文字提示,生成的影片會將圖像中的身份一致地套用到影片中的主體上。
Who it’s for
此工具針對需要可控影片生成的創作者與研究者,協助他們在不進行大量模型微調的情況下實現高保真度的身份保持。
Highlights
- Tuning-Free:無需為新主體進行額外訓練或微調,即可保持身份一致性。
- DiT-Based:基於 Diffusion Transformer 架構構建。
- Memory Optimizations:包括 CPU 卸載、VAE 切片與平鋪等選項,使模型能在顯存低於 44GB 的 GPU 上運行。
- Integration:已整合至 Hugging Face
diffusers套件中。 - Inference Acceleration:支援透過 xDiT 並行推論以及透過 TeaCache 快取推論。