linzhiqiu/t2v_metrics

Evaluating text-to-image/video/3D models with VQAScore

What it solves

VQAScore는 텍스트‑투‑비주얼 생성 모델(이미지, 비디오, 3D)의 품질과 정렬도를 자동으로 평가하도록 설계되었습니다. 기존의 CLIPScore와 같은 전통적인 지표를 대체하여, 이미지‑텍스트 생성 방식을 이용해 시각적 출력이 주어진 텍스트 프롬프트와 얼마나 잘 맞는지를 점수화하는 보다 견고한 접근 방식을 제공합니다.

How it works

이 프레임워크는 대형 멀티모달 모델(LMM)을 활용해 시각 입력과 프롬프트에 관한 질문이 주어졌을 때 특정 답변(예: "Yes")의 확률을 계산합니다. GPT-4o, Gemini 2.5, Gemma 3, 그리고 Qwen 패밀리(VL, 3.5, Omni) 등 최신 모델을 폭넓게 지원합니다.

오픈소스 Qwen 모델의 경우 forward_with_trace를 제공하여 토큰 수준의 투명성을 확보하고, 사용자가 점수를 매길 때 모델이 고려한 정확한 확률과 대안을 확인할 수 있게 합니다.

Who it’s for

복잡한 프롬프트에 대한 모델의 정확한 추종 정도를 표준화되고 자동화된 방법으로 측정하고자 하는 AI 연구자 및 개발자를 위한 도구입니다. 특히 구성적 텍스트‑투‑비주얼 생성에 적합합니다.

Highlights

  • Multimodal Support: 이미지, 비디오 및 오디오‑비주얼 정렬을 평가(Qwen3‑Omni 사용).
  • Broad Model Integration: 전용 API(GPT-4o, Vertex AI를 통한 Gemini)와 오픈웨이트 모델(Qwen, Gemma, PaliGemma) 모두와 호환.
  • Flexible Templating: 질문 및 답변 템플릿을 사용자 정의하여 스코어링 방식을 변경 가능.
  • Benchmarking Tools: 구성 생성 평가를 위한 GenAI‑Bench와의 통합 포함.