gudaochangsheng/RefAlign
[ECCV 2026] Official PyTorch implementation of RefAlign: Representation Alignment for Reference-to-Video Generation
What it solves
参考图转视频 (R2V) 生成通常面临 ""copy-paste artifacts"" (复制-粘贴伪影) 和 ""multi-subject confusion"" (多主体混淆) 的问题,即模型无法维持参考主体的身份特征,或者在场景中混淆了多个主体。RefAlign 通过提高参考忠实度、身份一致性和文本可控性来解决这些问题。
How it works
RefAlign 是一个训练阶段的表示对齐框架。它显式地将 Diffusion Transformer (DiT) 参考分支的特征与冻结的视觉基础模型 (VFM)(例如 DINOv3)的特征空间进行对齐。它使用一种参考对齐损失函数,将相同主体的特征拉近,并将不同主体的特征推开。由于这种对齐仅发生在训练期间,因此在推理阶段,VFM 和对齐模块会被丢弃,从而不会产生额外的计算开销。
Who it’s for
该项目适用于从事可控视频合成、个性化广告、虚拟试穿和身份一致性视频创作的 AI 研究人员和开发者。
Highlights
- Zero Inference Overhead: 对齐过程仅在训练期间使用,因此不会减慢视频生成速度。
- SOTA Performance: 在 OpenS2V-Eval 基准测试中实现了最先进 (SOTA) 的结果。
- Flexible Model Sizes: 提供 1.3B 和 14B 参数模型的权重文件 (checkpoints)。
- Improved Fidelity: 专门针对并减少了常见的 R2V 伪影,例如复制-粘贴效果。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目