Weistrass/DyRef

[ECCV 2026 Oral] Official repository for Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

解决的问题

DyRef 解决了开源图像生成模型在处理多张不同类型的参考图像(例如:结合特定主体、特定风格和特定姿势)时所出现的性能下降问题。它能防止模型随着请求复杂度的增加,而忽略某些参考图像或无法准确将其结合。

运作原理

DyRef 使用两阶段训练框架来改善多参考图像生成 (MRIG):

  1. 第一阶段 (SFT): 模型首先通过监督微调 (SFT) 进行训练,以建立处理复杂多参考任务的基本能力。
  2. 第二阶段 (RL): 模型使用两个特定机制进行强化学习 (RL):
    • 动态奖励塑形 (DRS): 增加样本间的奖励差异,使训练更有效。
    • 动态注意力奖励 (DAR): 迫使模型更关注包含大量混合类型参考图像的样本。

此外,该项目还提供了一个自动化数据合成流水线,用于创建这些复杂任务所需的训练数据。

适用对象

从事可控图像生成、创意 AI 工具和视频关键帧生成的研究人员与开发者,这些领域需要对多个视觉属性进行精确控制。

亮点

  • OmniRef-Bench: 一个新的基准测试,用于评估模型保留和结合多样参考类型(主体、风格、背景、光线和姿势)的能力。
  • 广泛兼容性: 增强多个基础模型,包括 Qwen-Image-Edit-2511 和 FLUX.2-klein-base。
  • 性能提升: 达到与 Nano Banana Pro 等高端闭源模型相当的结果。
  • 无回归现象: 提升多参考能力的同时,不损害基础模型的一般能力。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目