Weistrass/DyRef
[ECCV 2026 Oral] Official repository for Scaling Multi-Reference Image Generation with Dynamic Reward Optimization
解决的问题
DyRef 解决了开源图像生成模型在处理多张不同类型的参考图像(例如:结合特定主体、特定风格和特定姿势)时所出现的性能下降问题。它能防止模型随着请求复杂度的增加,而忽略某些参考图像或无法准确将其结合。
运作原理
DyRef 使用两阶段训练框架来改善多参考图像生成 (MRIG):
- 第一阶段 (SFT): 模型首先通过监督微调 (SFT) 进行训练,以建立处理复杂多参考任务的基本能力。
- 第二阶段 (RL): 模型使用两个特定机制进行强化学习 (RL):
- 动态奖励塑形 (DRS): 增加样本间的奖励差异,使训练更有效。
- 动态注意力奖励 (DAR): 迫使模型更关注包含大量混合类型参考图像的样本。
此外,该项目还提供了一个自动化数据合成流水线,用于创建这些复杂任务所需的训练数据。
适用对象
从事可控图像生成、创意 AI 工具和视频关键帧生成的研究人员与开发者,这些领域需要对多个视觉属性进行精确控制。
亮点
- OmniRef-Bench: 一个新的基准测试,用于评估模型保留和结合多样参考类型(主体、风格、背景、光线和姿势)的能力。
- 广泛兼容性: 增强多个基础模型,包括 Qwen-Image-Edit-2511 和 FLUX.2-klein-base。
- 性能提升: 达到与 Nano Banana Pro 等高端闭源模型相当的结果。
- 无回归现象: 提升多参考能力的同时,不损害基础模型的一般能力。
相关
- 项目
- 项目
- 项目
- 项目
- 项目