Karine-Huang/T2I-CompBench

[Neurips 2023 & TPAMI] T2I-CompBench (++) for Compositional Text-to-image Generation Evaluation

What it solves

T2I-CompBench (以及其增強版本 T2I-CompBench++) 是一個全面的基準測試,旨在評估文本生成圖像 (T2I) 模型在處理組合式元素時的表現。它解決了確保 AI 生成的圖像能準確反映複雜提示詞的挑戰,特別專注於屬性綁定、空間關係和數量能力。

How it works

該專案提供了一個數據集和一套評估指標,用於測試 T2I 模型。它使用多種專業工具來衡量準確度:

  • BLIP-VQA: 用於評估屬性綁定(例如,確保「綠色長凳」確實是綠色的)。
  • UniDet: 用於 2D/3D 空間關係和數量能力(計算物體數量)。
  • CLIPScore: 用於非空間關係。
  • MLLM Evaluation: 支援使用多模態大語言模型 (MLLMs) 如 GPT-4V, MiniMax M2.7, 和 ShareGPT4V-CoT 來為圖像-文本對齊度進行評分。
  • GORS Finetuning: 包含一種透過 LoRA 對擴散模型進行微調的方法,以根據基於獎勵的反饋來提升其組合式表現。

Who it’s for

  • AI Researchers: 開發新文本生成圖像模型或改進現有模型的開發者。
  • Model Evaluators: 需要標準化方式來衡量模型是否能正確放置物體並將屬性綁定到正確項目上的評估者。

Highlights

  • Industry Adoption: 其評估指標已被 DALL-E 3, Stable Diffusion 3, 和 PixArt-α 等主要模型採用。
  • Comprehensive Scope: 涵蓋屬性綁定、2D/3D 空間關係、數量能力以及複雜的組合式結構。
  • MLLM Integration: 整合了現代視覺語言模型,以實現自動化、高質量的評估。