gudaochangsheng/RefAlign
[ECCV 2026] Official PyTorch implementation of RefAlign: Representation Alignment for Reference-to-Video Generation
何を解決するか
Reference-to-video (R2V) 生成は、「コピー・ペーストアーティファクト」と「複数の被写体の混同」に悩まされることが多く、モデルが参照対象のアイデンティティを維持できなかったり、シーン内の複数の被写体を混同したりする。RefAlignは、参照の忠実度、アイデンティティの一貫性、テキスト制御性を向上させることで、これらの問題に対処する。
仕組み
RefAlignはトレーニング時における表現のアライメントフレームワークである。Diffusion Transformer (DiT) の参照ブランチの特徴量を、DINOv3 などの固定された視覚基盤モデル (VFM) の特徴空間に明示的にアライメントさせる。このアライメントには、同じ被写体の特徴量を近づけ、異なる被写体の特徴量を遠ざける「参照アライメント損失」が使用される。このアライメントはトレーニング時のみに実行されるため、推論時には VFM とアライメントモジュールが削除され、追加の計算負荷が生じない。
対象となるユーザー
このプロジェクトは、制御可能な動画合成、パーソナライズ広告、バーチャルトライオン、アイデンティティ一貫性のある動画作成に取り組む AI リサーチャーおよび開発者向けである。
特徴
- 推論時のオーバーヘッドなし: アライメント処理はトレーニング時のみに使用されるため、動画生成の速度を落とさない。
- 最先端のパフォーマンス: OpenS2V-Eval ベンチマークで最先端の結果を達成している。
- 柔軟なモデルサイズ: 1.3B および 14B パラメータのモデル用のチェックポイントを提供している。
- 忠実度の向上: コピー・ペースト効果など、R2V で一般的なアーティファクトを特にターゲットにし、低減している。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト