HorizonWind2004/reconstruction-alignment

[ICLR 2026] RecA: visual understanding help generation through self-supervised learning

해결하는 문제

RecA (Reconstruction Alignment)는 통합 다중모달 모델(UMMs)에서 시각적 이해와 이미지 생성 간의 격차를 해결합니다. 비용이 많이 드는 이미지 전용 설명문이나 강화 학습 없이도 텍스트에서 이미지 생성 및 이미지 편집의 품질을 향상시키는 것을 목표로 합니다.

작동 방식

RecA는 자기지도(post-training) 방법입니다. 기존에 학습된 UMM이 자신의 내부 시각적 이해 특징에서 원본 이미지를 재구성하도록 훈련합니다. 이 과정에서 모델의 생성 능력과 의미적 이해가 일치하게 되어, 생성 및 편집 작업에서 더 나은 성능을 보이게 되며, 원래의 추론 인터페이스는 유지됩니다.

대상 사용자

통합 다중모달 모델을 사용하고 있으며, 자기지도적 정렬을 통해 이미지 생성 및 편집 능력을 향상시키고자 하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 아키텍처 독립성: BAGEL, Harmon, OpenUni, Show-o 등 다양한 아키텍처에서 검증됨.
  • 효율적인 훈련: 예를 들어, BAGEL은 6개의 80GB A100을 사용해 약 4.5시간 내에 생성 및 편집 벤치마크에서 개선 가능.
  • 자기지도 학습: 수동 설명문 대신 원본 이미지를 타겟으로 사용.
  • 성능 향상: 0.5B에서 14B 파라미터 규모의 다양한 모델에서 GenEval 및 DPGBench와 같은 벤치마크에서 상당한 성능 향상이 나타남.

"RecA는 모델이 스스로 이미지를 재구성하도록 훈련함으로써, 생성과 이해의 일관성을 높이는 혁신적인 접근입니다." — @recalibra

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch