linzhiqiu/t2v_metrics

Evaluating text-to-image/video/3D models with VQAScore

What it solves

VQAScore 旨在自动评估文本到视觉生成模型(图像、视频和 3D)的质量与对齐度。它以更稳健的方式取代传统的 CLIPScore 等指标,通过图像‑文本生成来评分视觉输出与给定文本提示的匹配程度。

How it works

该框架利用大型多模态模型(LMM)计算在给定视觉输入和关于提示的问题时,特定答案(例如 “Yes”)的概率。它支持众多最先进模型,包括 GPT-4o、Gemini 2.5、Gemma 3 以及 Qwen 系列(VL、3.5、Omni)。

对于开源的 Qwen 模型,框架提供 forward_with_trace 以实现 token 级别的透明度,让用户能够看到模型在打分时考虑的精确概率和备选答案。

Who it’s for

适用于需要标准化、自动化方式衡量模型对复杂提示遵循程度的 AI 研究者和开发者,特别是针对组合式文本到视觉生成的场景。

Highlights

  • Multimodal Support: 评估图像、视频和音视频对齐(通过 Qwen3‑Omni)。
  • Broad Model Integration: 兼容专有 API(GPT-4o、Gemini via Vertex AI)和开源权重模型(Qwen、Gemma、PaliGemma)。
  • Flexible Templating: 允许用户自定义问题和答案模板,以改变评分方式。
  • Benchmarking Tools: 包含与 GenAI‑Bench 的集成,用于评估组合式生成。