Karine-Huang/T2I-CompBench
[Neurips 2023 & TPAMI] T2I-CompBench (++) for Compositional Text-to-image Generation Evaluation
What it solves
T2I-CompBench (以及其增强版本 T2I-CompBench++) 是一个全面的基准测试,旨在评估文本生成图像 (T2I) 模型在处理组合式元素时表现如何。它解决了确保 AI 生成的图像能准确反映复杂提示词的挑战,特别专注于属性绑定、空间关系和数量能力。
How it works
该项目提供了一个数据集和一个评估指标套件,用于测试 T2I 模型。它使用多种专业工具来衡量准确度:
- BLIP-VQA: 用于评估属性绑定(例如,确保 ""green bench"" 确实是绿色的)。
- UniDet: 用于 2D/3D 空间关系和数量能力(计算物体数量)。
- CLIPScore: 用于非空间关系。
- MLLM Evaluation: 支持使用多模态大语言模型 (MLLMs) 如 GPT-4V, MiniMax M2.7, 和 ShareGPT4V-CoT 来为图像-文本对齐度进行评分。
- GORS Finetuning: 包含一种通过 LoRA 对扩散模型进行微调的方法,以根据基于奖励的反馈来提高其组合式性能。
Who it’s for
- AI Researchers: 开发新文本生成图像模型或改进现有模型的研发人员。
- Model Evaluators: 需要标准化方式来衡量模型是否能正确放置物体并将其属性绑定到正确的项目上的人员。
Highlights
- Industry Adoption: 其评估指标已被 DALL-E 3, Stable Diffusion 3, 和 PixArt-α 等主要模型采用。
- Comprehensive Scope: 涵盖属性绑定、2D/3D 空间关系、数量能力以及复杂的组合式结构。
- MLLM Integration: 整合了现代视觉语言模型,以实现自动化的、高质量的评估。