Karine-Huang/T2I-CompBench
[Neurips 2023 & TPAMI] T2I-CompBench (++) for Compositional Text-to-image Generation Evaluation
What it solves
T2I-CompBench (및 그 강화 버전 T2I-CompBench++)는 텍스트-이미지(T2I) 생성 모델이 구성 요소들을 얼마나 잘 처리하는지 평가하기 위해 설계된 종합적인 벤치마크입니다. AI 생성 이미지가 복잡한 프롬프트를 정확하게 반영하는지 확인하는 문제를 해결하며, 특히 속성 바인딩, 공간 관계, 그리고 수치 능력을 다룹니다.
How it works
이 프로젝트는 T2I 모델을 테스트하기 위한 데이터셋과 평가 지표 세트를 제공합니다. 정확도를 측정하기 위해 다음과 같은 전문 도구를 사용합니다:
- BLIP-VQA: 속성 바인딩을 평가하는 데 사용됩니다 (예: ""green bench""가 실제로 초록색인지 확인).
- UniDet: 2D/3D 공간 관계 및 수치 능력을 (객체 수 세기) 측정하는 데 사용됩니다.
- CLIPScore: 비공간적 관계를 측정하는 데 사용합니다.
- MLLM Evaluation: GPT-4V, MiniMax M2.7, ShareGPT4V-CoT와 같은 멀티모달 대규모 언어 모델(MLLMs)을 사용하여 이미지-텍스트 정렬도를 점수화합니다.
- GORS Finetuning: 보상 기반 피드백을 통해 확산 모델의 구성 요소 성능을 개선하기 위해 (LoRA를 통해) 확산 모델을 미세 조정하는 방법을 포함합니다.
Who it’s for
- AI Researchers: 새로운 텍스트-이미지 모델을 개발하거나 기존 모델을 개선하는 연구자.
- Model Evaluators: 모델이 객체를 올바르게 배치하고 속성을 올바른 적절한 항목에 바인딩하는지 측정하기 위한 표준화된 방법이 필요한 평가자.
Highlights
Industry Adoption: 이 평가 지표는 DALL-E 3, Stable Diffusion 3, PixArt-α를 포함한 주요 모델에 의해 채택되었습니다.
Comprehensive Scope: 속성 바인딩, 2D/3D 공간 관계, 수치 능력, 그리고 복잡한 구성을 다룹니다.
MLLM Integration: 자동화된, 고품질의 평가를 위해 현대적인 비전-언어 모델을 통합합니다.