linzhiqiu/t2v_metrics

Evaluating text-to-image/video/3D models with VQAScore

What it solves

VQAScore 旨在自動評估文字到視覺生成模型(圖像、影片與 3D)的品質與對齊度。它以更健全的方式取代傳統的 CLIPScore 等指標,透過圖像‑文字生成來評分視覺輸出與給定文字提示的匹配程度。

How it works

此框架利用大型多模態模型(LMM)計算在給定視覺輸入與關於提示的問題時,特定答案(例如「Yes」)的機率。它支援眾多最先進模型,包括 GPT-4o、Gemini 2.5、Gemma 3 以及 Qwen 系列(VL、3.5、Omni)。

對於開源的 Qwen 模型,框架提供 forward_with_trace 以實現 token 級別的透明度,讓使用者能看到模型在給分時考慮的精確機率與備選答案。

Who it’s for

適合需要標準化、全自動方式衡量模型對複雜提示遵循程度的 AI 研究者與開發者,特別是針對組合式文字到視覺生成的情境。

Highlights

  • Multimodal Support: 評估圖像、影片與音視覺對齊(透過 Qwen3‑Omni)。
  • Broad Model Integration: 相容於專有 API(GPT-4o、Gemini via Vertex AI)與開源權重模型(Qwen、Gemma、PaliGemma)。
  • Flexible Templating: 允許使用者自訂問題與答案模板,以改變評分方式。
  • Benchmarking Tools: 包含與 GenAI‑Bench 的整合,用於評估組合式生成。