PKU-YuanGroup/ConsisID

[CVPR 2025 Highlight🔥] Identity-Preserving Text-to-Video Generation by Frequency Decomposition

What it solves

ConsisID 解决了文本生成视频时跨帧保持一致的人类身份的难题。它防止了 AI 生成视频中常出现的人物外观“漂移”,确保整段视频中的主体始终是同一个人。

How it works

ConsisID 是一个无需调优的 Diffusion Transformer(DiT)模型。它利用频率分解,借鉴视觉和扩散 Transformer 的频率分析,以保持身份一致性。系统接受人物的参考图像和文本提示,生成的视频会将图像中的身份一致地应用到视频中的主体上。

Who it’s for

该工具面向需要可控视频生成的创作者和研究者,帮助他们在不进行大量模型微调的情况下实现高保真度的身份保持。

Highlights

  • Tuning-Free:无需为新主体进行额外训练或微调,即可保持身份一致性。
  • DiT-Based:基于 Diffusion Transformer 架构构建。
  • Memory Optimizations:包括 CPU 卸载、VAE 切片和平铺等选项,使模型能够在显存低于 44GB 的 GPU 上运行。
  • Integration:已集成到 Hugging Face diffusers 库中。
  • Inference Acceleration:支持通过 xDiT 并行推理以及通过 TeaCache 缓存推理。