PKU-YuanGroup/ConsisID
[CVPR 2025 Highlight🔥] Identity-Preserving Text-to-Video Generation by Frequency Decomposition
What it solves
ConsisID는 텍스트‑투‑비디오 생성에서 프레임 간 인간 정체성을 일관되게 유지하는 문제를 해결합니다. AI가 만든 영상에서 흔히 발생하는 인물 외모의 "이동"을 방지하여, 클립 전체에 걸쳐 동일 인물임을 보장합니다.
How it works
ConsisID는 튜닝이 필요 없는 Diffusion Transformer (DiT) 기반 모델입니다. 비전 및 디퓨전 트랜스포머의 주파수 분석을 활용한 주파수 분해를 이용해 정체성을 보존합니다. 시스템은 사람의 레퍼런스 이미지와 텍스트 프롬프트를 받아, 이미지의 정체성이 영상 속 피사체에 일관되게 적용된 비디오를 생성합니다.
Who it’s for
이 도구는 제어 가능한 비디오 생성 작업을 하는 크리에이터와 연구자를 위해 설계되었으며, 광범위한 모델 파인튜닝 없이도 높은 정밀도의 정체성 보존이 필요한 경우에 적합합니다.
Highlights
- Tuning-Free: 새로운 피사체에 대해 추가 학습이나 파인튜닝 없이도 정체성 일관성을 유지합니다.
- DiT-Based: Diffusion Transformer 아키텍처 위에 구축되었습니다.
- Memory Optimizations: CPU 오프로드, VAE 슬라이싱, 타일링 등 옵션을 포함해 44GB 미만 VRAM을 가진 GPU에서도 실행할 수 있습니다.
- Integration: Hugging Face
diffusers라이브러리에 통합되었습니다. - Inference Acceleration: xDiT를 통한 병렬 추론 및 TeaCache를 이용한 캐시 추론을 지원합니다.