linzhiqiu/t2v_metrics
Evaluating text-to-image/video/3D models with VQAScore
What it solves
VQAScore 旨在自動評估文字到視覺生成模型(圖像、影片與 3D)的品質與對齊度。它以更健全的方式取代傳統的 CLIPScore 等指標,透過圖像‑文字生成來評分視覺輸出與給定文字提示的匹配程度。
How it works
此框架利用大型多模態模型(LMM)計算在給定視覺輸入與關於提示的問題時,特定答案(例如「Yes」)的機率。它支援眾多最先進模型,包括 GPT-4o、Gemini 2.5、Gemma 3 以及 Qwen 系列(VL、3.5、Omni)。
對於開源的 Qwen 模型,框架提供 forward_with_trace 以實現 token 級別的透明度,讓使用者能看到模型在給分時考慮的精確機率與備選答案。
Who it’s for
適合需要標準化、全自動方式衡量模型對複雜提示遵循程度的 AI 研究者與開發者,特別是針對組合式文字到視覺生成的情境。
Highlights
- Multimodal Support: 評估圖像、影片與音視覺對齊(透過 Qwen3‑Omni)。
- Broad Model Integration: 相容於專有 API(GPT-4o、Gemini via Vertex AI)與開源權重模型(Qwen、Gemma、PaliGemma)。
- Flexible Templating: 允許使用者自訂問題與答案模板,以改變評分方式。
- Benchmarking Tools: 包含與 GenAI‑Bench 的整合,用於評估組合式生成。