Weistrass/DyRef
[ECCV 2026 Oral] Official repository for Scaling Multi-Reference Image Generation with Dynamic Reward Optimization
해결하는 문제
DyRef는 오픈소스 이미지 생성 모델이 서로 다른 유형의 여러 참조 이미지(예: 특정 피사체, 특정 스타일, 특정 포즈 결합)를 동시에 처리해야 할 때 발생하는 성능 저하 문제를 해결합니다. 요청의 복잡성이 증가함에 따라 모델이 일부 참조를 무시하거나 정확하게 결합하지 못하는 것을 방지합니다.
작동 방식
DyRef는 다중 참조 이미지 생성(MRIG)을 개선하기 위해 2단계 훈련 프레임워크를 사용합니다:
- 1단계 (SFT): 모델은 먼저 지도 파인튜닝(SFT)을 통해 훈련되어 복잡한 다중 참조 작업을 처리하기 위한 기본 기능을 확립합니다.
- 2단계 (RL): 모델은 두 가지 특정 메커니즘을 사용하여 강화 학습(RL)을 진행합니다:
- 동적 보상 형성(DRS): 샘플 간의 보상 차이를 증가시켜 훈련을 더 효과적으로 만듭니다.
- 동적 어텐션 보상(DAR): 모델이 혼합 유형 참조 이미지가 많이 포함된 샘플에 더 집중하도록 강제합니다.
또한, 이 프로젝트는 이러한 복잡한 작업에 필요한 훈련 데이터를 생성하기 위한 자동화된 데이터 합성 파이프라인을 제공합니다.
대상 독자
제어 가능한 이미지 생성, 크리에이티브 AI 도구 및 여러 시각적 속성에 대한 정밀한 제어가 필요한 비디오 키프레임 생성을 연구하는 연구원 및 개발자.
하이라이트
- OmniRef-Bench: 모델이 다양한 참조 유형(피사체, 스타일, 배경, 조명, 포즈)을 유지하고 결합하는 정도를 평가하기 위한 새로운 벤치마크입니다.
- 폭넓은 호환성: Qwen-Image-Edit-2511 및 FLUX.2-klein-base를 포함한 여러 기반 모델을 향상시킵니다.
- 성능 향상: Nano Banana Pro와 같은 최고급 폐쇄형 모델에 필적하는 결과를 달성합니다.
- 성능 저하 없음: 기반 모델의 일반적인 기능을 손상시키지 않고 다중 참조 기능을 향상시킵니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트