Weistrass/DyRef

[ECCV 2026 Oral] Official repository for Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

解決する課題

DyRef は、オープンソースの画像生成モデルが、異なる種類の複数の参照画像(例:特定の被写体、特定のスタイル、特定のポーズの組み合わせ)を同時に処理するよう求められた際に見られるパフォーマンスの低下に対処します。リクエストの複雑さが増すにつれて、モデルが一部の参照を無視したり、正確に組み合わせることができなくなったりするのを防ぎます。

仕組み

DyRef は、多参照画像生成 (MRIG) を改善するために二段階トレーニングフレームワークを使用します:

  1. ステージ I (SFT): モデルはまず、監督付きファインチューニング (SFT) によって訓練され、複雑な多参照タスクを処理するための基本的な能力を確立します。
  2. ステージ II (RL): モデルは 2 つの特定のメカニズムを使用して強化学習 (RL) を行います:
    • 動的報酬形成 (DRS): サンプル間の報酬の差異を増加させ、トレーニングをより効果的にします。
    • 動的アテンション報酬 (DAR): 混合タイプの参照画像が多く含まれるサンプルにモデルがより注意を向けるように強制します。

さらに、このプロジェクトは、これらの複雑なタスクに必要なトレーニングデータを作成するための自動化データ合成パイプラインを提供します。

対象者

制御可能な画像生成、クリエイティブ AI ツール、および複数の視覚属性の正確な制御が必要なビデオキーフレーム生成に取り組む研究者や開発者。

ハイライト

  • OmniRef-Bench: モデルが多様な参照タイプ(被写体、スタイル、背景、照明、ポーズ)を保持し組み合わせる能力を評価するための新しいベンチマーク。
  • 幅広い互換性: Qwen-Image-Edit-2511 や FLUX.2-klein-base を含む複数の基盤モデルを強化します。
  • パフォーマンスの向上: Nano Banana Pro のようなハイエンドなクローズドソースモデルに匹敵する結果を達成します。
  • リグレッションなし: 基盤モデルの汎用能力を損なうことなく、多参照能力を向上させます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト