gudaochangsheng/RefAlign

[ECCV 2026] Official PyTorch implementation of RefAlign: Representation Alignment for Reference-to-Video Generation

解決的問題

參考到影片生成(R2V)經常面臨「複製貼上偽影」與「多主體混淆」的問題,即模型無法維持參考主體的身份,或在場景中混淆多個主體。RefAlign 透過提升參考保真度、身份一致性與文字可控性來解決這些問題。

工作原理

RefAlign 是一種訓練時的表示對齊框架。它明確地將擴散 Transformer(DiT)參考分支的特徵對齊至固定視覺基礎模型(VFM),例如 DINOv3 的特徵空間。它使用參考對齊損失,將相同主體的特徵拉近,並將不同主體的特徵推遠。由於此對齊僅在訓練期間進行,因此在推論時會捨棄 VFM 與對齊模組,不會帶來額外的計算負擔。

適用對象

本專案適用於從事可控影片合成、個人化廣告、虛擬試穿以及身份一致影片創作的 AI 研究人員與開發者。

主要亮點

  • 零推論開銷:對齊過程僅在訓練時使用,不會減慢影片生成速度。
  • SOTA 性能:在 OpenS2V-Eval 基準上達到最優水平。
  • 靈活的模型尺寸:提供 1.3B 與 14B 參數模型的檢查點。
  • 提升保真度:專門針對並減少常見的 R2V 偽影,如複製貼上效應。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案