gudaochangsheng/RefAlign

[ECCV 2026] Official PyTorch implementation of RefAlign: Representation Alignment for Reference-to-Video Generation

해결하는 문제

Reference-to-video (R2V) 생성은 종종 "copy-paste artifacts"와 "multi-subject confusion" 문제를 겪습니다. 이는 모델이 참조 대상의 정체성을 유지하지 못하거나 장면 내의 여러 대상을 혼동하는 현상을 의미합니다. RefAlign은 참조 충실도(reference fidelity), 정체성 일관성(identity consistency), 그리고 텍스트 제어 가능성(text controllability)을 개선하여 이러한 문제를 해결합니다.

작동 방식

RefAlign은 학습 단계에서의 표현 정렬(representation alignment) 프레임워크입니다. 이는 Diffusion Transformer (DiT) 참조 브랜치의 특징(features)을 DINOv3와 같은 동결된 시각적 기초 모델(VFM)의 특징 공간(feature space)에 명시적으로 정렬합니다. 동일한 대상의 특징은 더 가깝게 끌어당기고 서로 다른 대상의 특징은 더 멀리 밀어내는 참조 정렬 손실(reference alignment loss)을 사용합니다. 이 정렬은 학습 중에만 발생하므로, 추론(inference) 단계에서는 VFM과 정렬 모듈을 폐기하여 추가적인 계산 오버헤드가 발생하지 않습니다.

대상 사용자

이 프로젝트는 제어 가능한 비디오 합성, 개인화된 광고, 가상 피팅(virtual try-on), 그리고 정체성 일관성이 유지되는 비디오 생성 분야에서 작업하는 AI 연구자 및 개발자를 대상으로 합니다.

주요 특징

  • Zero Inference Overhead: 정렬 과정은 학습 중에만 사용되므로 비디오 생성 속도를 늦추지 않습니다.
  • SOTA Performance: OpenS2V-Eval 벤치마크에서 최첨단(state-of-the-art) 성능을 달성합니다.
  • Flexible Model Sizes: 1.3B 및 14B 파라미터 모델 모두에 대한 체크포인트를 제공합니다.
  • Improved Fidelity: 특히 copy-paste 효과와 같은 일반적인 R2V 아티팩트를 타겟팅하여 줄여줍니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트