linzhiqiu/t2v_metrics
Evaluating text-to-image/video/3D models with VQAScore
What it solves
VQAScore 旨在自动评估文本到视觉生成模型(图像、视频和 3D)的质量与对齐度。它以更稳健的方式取代传统的 CLIPScore 等指标,通过图像‑文本生成来评分视觉输出与给定文本提示的匹配程度。
How it works
该框架利用大型多模态模型(LMM)计算在给定视觉输入和关于提示的问题时,特定答案(例如 “Yes”)的概率。它支持众多最先进模型,包括 GPT-4o、Gemini 2.5、Gemma 3 以及 Qwen 系列(VL、3.5、Omni)。
对于开源的 Qwen 模型,框架提供 forward_with_trace 以实现 token 级别的透明度,让用户能够看到模型在打分时考虑的精确概率和备选答案。
Who it’s for
适用于需要标准化、自动化方式衡量模型对复杂提示遵循程度的 AI 研究者和开发者,特别是针对组合式文本到视觉生成的场景。
Highlights
- Multimodal Support: 评估图像、视频和音视频对齐(通过 Qwen3‑Omni)。
- Broad Model Integration: 兼容专有 API(GPT-4o、Gemini via Vertex AI)和开源权重模型(Qwen、Gemma、PaliGemma)。
- Flexible Templating: 允许用户自定义问题和答案模板,以改变评分方式。
- Benchmarking Tools: 包含与 GenAI‑Bench 的集成,用于评估组合式生成。