Vchitect/VBench
[CVPR2024 Highlight] VBench - We Evaluate Video Generation
VBench – 비디오 생성 모델을 위한 벤치마크 스위트
무엇인가요? VBench(및 확장 버전 VBench++ 및 VBench-2.0)는 현대적인 비디오 생성 AI를 위한 오픈소스 평가 프레임워크입니다. 연구자들과 개발자들이 생성된 비디오를 광범위하고 잘 정의된 품질 차원상에서 자동으로 점수를 매길 수 있도록 하는 통합된 코드베이스를 제공합니다.
왜 중요한가요 비디오-텍스트 모델의 성능은 폭발적으로 성장했지만, 출력물의 품질을 측정하는 단일하고 합의된 방법은 아직 없습니다. VBench는 "비디오 생성 품질"을 평가 차원 (예: 피사체 일관성, 시간적 깜빡임, 움직임의 부드러움, 미학적 품질, 신뢰성, 내재적 충실도 등)의 계층 구조로 세분화하고 다음과 같은 기능을 제공함으로써 이 문제를 해결합니다:
- 프롬프트 스위트 – 각 차원과 콘텐츠 카테고리에 대해 큐레이션된 텍스트 프롬프트.
- 평가 방법 스위트 – 각 차원별 점수를 계산하는 자동 메트릭 및 파이프라인.
- 인간 선호도 어노테이션 – 자동 점수가 인간이 인지하는 품질과 일치함을 보여주는 검증 레이어.
- 리더보드 & 아레나 – 연구자들이 결과를 업로드하고, 샘플 비디오를 확인하며, 모델을 비교할 수 있는 공개 Hugging Face spaces.
주요 구성 요소
| 구성 요소 | 범위 | 리포지토리 내 위치 |
|---|---|---|
| VBench (원본) | 16가지 text-to-video 차원 (피사체 일관성, 배경 일관성, 시간적 깜빡임, 움직임의 부드러움, 동적 정도, 미학적 품질, 영상 품질, 객체 클래스, 다중 객체, 인간 동작, 색상, 공간 관계, 장면, 시간적 스타일, 외관 스타일, 전체적 일관성) | . (root) |
| VBench++ | VBench를 확장하여: • VBench-I2V – 이미지-투-비디오 평가 • VBench-Long – 롱 비디오(Sora 스타일)를 위한 메트릭 • VBench-Trustworthiness – 공정성, 편향, 안전성 체크 |
vbench2_beta_i2v, vbench2_beta_long, vbench2_beta_trustworthiness |
| VBench-2.0 | 내재적 충실도 차원 추가 (상식적 추론, 물리적 사실성, 인간 동작, 창의적 구성 등) – 5개 광범위한 카테고리, 18개 세부 능력 | VBench-2.0 |
어떻게 시작하나요
- 설치 (Python 3.9+ 권장) – 패키지는 PyPI에 있습니다:
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118 # pick the CUDA version you need pip install vbench - 벤치마크 선택 – 적절한 클래스 (예:
VBench,VBenchI2V,VBenchLong,VBenchTrustworthiness, 또는 VBench-2.0 스위트)를 임포트하고 생성된 비디오 폴더를 지정합니다. - 평가 실행 – 단일 호출로 선택된 차원의 모든 메트릭을 계산하고 점수 딕셔너리를 반환합니다. 라이브러리는 레이더 차트 시각화 및 공개 리더보드와 비교를 위한 유틸리티도 제공합니다.
- 결과 제출 – README에 링크된 Hugging Face “VBench Arena” spaces에 점수(또는 생성된 비디오)를 업로드하여 이미 리스트된 ~40여 개의 모델 중 자신의 모델이 어디에 위치하는지 확인하세요.
리소스 & 커뮤니티
- 논문: CVPR 2024 (VBench) 및 TPAMI 2025 (VBench++) – 둘 다 README에 링크되어 있습니다.
- 리더보드 & 비디오 아레나: VBench, VBench-I2V, VBench-2.0 등을 위한 Hugging Face spaces.
- 데이터셋: 벤치마크에 사용된 모든 샘플링 비디오가 포함된 Google-Drive 폴더 (README에 다운로드 링크가 있습니다).
- 인용: 각 버전별로 BibTex 항목이 제공됩니다. 벤치마크를 사용할 때 적절한 논의문을 인용하십시오.
누가 사용해야 하나요?
- 새로운 text-to-video, image-to-video, 또는 롱 비디오 생성 모델을 개발하는 연구자.
- 객관적인 품질 보고서가 필요한 상업용 비디오 생성 서비스를 구축하는 엔지니어.
- 비디오 생성의 공정성, 편향, 안전성에 관한 진정행을 추적하는 데 관심이 있는 모든 사람.
위의 모든 정보는 리포지토리의 README에서 직접 가져온 것입니다; 외부의 가정은 추가되지 않았습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트