Weistrass/DyRef

[ECCV 2026 Oral] Official repository for Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

解決的問題

DyRef 解決了開源影像生成模型在處理多張不同類型的參考影像(例如:結合特定主體、特定風格和特定姿勢)時所出現的效能下降問題。它能防止模型隨著請求複雜度的增加,而忽略某些參考影像或無法準確將其結合。

運作原理

DyRef 使用兩階段訓練框架來改善多參考影像生成 (MRIG):

  1. 第一階段 (SFT): 模型首先透過監督微調 (SFT) 進行訓練,以建立處理複雜多參考任務的基本能力。
  2. 第二階段 (RL): 模型使用兩個特定機制進行強化學習 (RL):
    • 動態獎勵塑形 (DRS): 增加樣本間的獎勵差異,使訓練更有效。
    • 動態注意力獎勵 (DAR): 迫使模型更關注包含大量混合類型參考影像的樣本。

此外,該專案還提供了一個自動化資料合成管線,用於建立這些複雜任務所需的訓練資料。

適用對象

從事可控影像生成、創意 AI 工具和影片關鍵影格生成的研究人員與開發者,這些領域需要對多個視覺屬性進行精確控制。

亮點

  • OmniRef-Bench: 一個新的基準測試,用於評估模型保留和結合多樣參考類型(主體、風格、背景、光線和姿勢)的能力。
  • 廣泛相容性: 增強多個基礎模型,包括 Qwen-Image-Edit-2511 和 FLUX.2-klein-base。
  • 效能提升: 達到與 Nano Banana Pro 等高階閉源模型相當的結果。
  • 無回歸現象: 提升多參考能力的同時,不損害基礎模型的一般能力。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案