Karine-Huang/T2I-CompBench

[Neurips 2023 & TPAMI] T2I-CompBench (++) for Compositional Text-to-image Generation Evaluation

What it solves

T2I-CompBench (및 그 강화 버전 T2I-CompBench++)는 텍스트-이미지(T2I) 생성 모델이 구성 요소들을 얼마나 잘 처리하는지 평가하기 위해 설계된 종합적인 벤치마크입니다. AI 생성 이미지가 복잡한 프롬프트를 정확하게 반영하는지 확인하는 문제를 해결하며, 특히 속성 바인딩, 공간 관계, 그리고 수치 능력을 다룹니다.

How it works

이 프로젝트는 T2I 모델을 테스트하기 위한 데이터셋과 평가 지표 세트를 제공합니다. 정확도를 측정하기 위해 다음과 같은 전문 도구를 사용합니다:

  • BLIP-VQA: 속성 바인딩을 평가하는 데 사용됩니다 (예: ""green bench""가 실제로 초록색인지 확인).
  • UniDet: 2D/3D 공간 관계 및 수치 능력을 (객체 수 세기) 측정하는 데 사용됩니다.
  • CLIPScore: 비공간적 관계를 측정하는 데 사용합니다.
  • MLLM Evaluation: GPT-4V, MiniMax M2.7, ShareGPT4V-CoT와 같은 멀티모달 대규모 언어 모델(MLLMs)을 사용하여 이미지-텍스트 정렬도를 점수화합니다.
  • GORS Finetuning: 보상 기반 피드백을 통해 확산 모델의 구성 요소 성능을 개선하기 위해 (LoRA를 통해) 확산 모델을 미세 조정하는 방법을 포함합니다.

Who it’s for

  • AI Researchers: 새로운 텍스트-이미지 모델을 개발하거나 기존 모델을 개선하는 연구자.
  • Model Evaluators: 모델이 객체를 올바르게 배치하고 속성을 올바른 적절한 항목에 바인딩하는지 측정하기 위한 표준화된 방법이 필요한 평가자.

Highlights

  • Industry Adoption: 이 평가 지표는 DALL-E 3, Stable Diffusion 3, PixArt-α를 포함한 주요 모델에 의해 채택되었습니다.

  • Comprehensive Scope: 속성 바인딩, 2D/3D 공간 관계, 수치 능력, 그리고 복잡한 구성을 다룹니다.

  • MLLM Integration: 자동화된, 고품질의 평가를 위해 현대적인 비전-언어 모델을 통합합니다.