MME-Benchmarks/Video-MME-v2
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
해결하는 문제
Video-MME-v2는 다중모달 대규모 언어 모델(MLLM)의 진정한 동영상 이해 능력을 평가하기 위해 설계된 벤치마크입니다. 기존 벤치마크에서의 높은 순위 점수와 실제 사용자 경험 사이의 격차를 메우기 위해, 모델이 '산발적인 정답'이나 운 좋게 맞춘 경우에 높은 점수를 얻는 것을 방지하는 더 견고하고 점진적인 평가 시스템을 도입합니다.
작동 방식
이 벤치마크는 동영상 이해를 세 단계의 점진적인 난이도로 분해합니다:
- 레벨 1 (다중 포인트 정보 통합): 동영상 전반에 걸쳐 프레임, 오디오, 자막 등의 다중모달 신호를 검색하고 통합하는 능력을 테스트합니다.
- 레벨 2 (시간 이해): 상태 변화, 행동 시퀀스, 인과 관계를 포착하는 능력을 평가합니다.
- 레벨 3 (시간 복합 추론): 시간 정보를 외부 세계 지식과 사회적 일반 지식과 결합하는 능력을 테스트합니다.
견고성을 보장하기 위해 그룹화된 비선형 점수 매기기 메커니즘을 사용합니다. 질문은 네 개의 상호 관련된 질문 그룹으로 구성됩니다. 점수는 "관련성"(그룹 내 답변의 일관성) 또는 "논리성"(추론 체인의 타당성)에 기반하며, 관련 질문을 일관되고 논리적으로 올바르게 답변할 수 있는 모델을 보상합니다.
대상 사용자
이 프로젝트는 동영상 기반 다중모달 LLM의 연구자 및 개발자에게 적합합니다. 모델의 시간적 추론 능력과 다중모달 융합 능력을 엄격하게 측정하고자 하는 분들에게 최적입니다.
주요 특징
- 3단계 점진적 진행: 단순한 정보 검색에서 복잡한 시간적 추론까지 체계적으로 테스트합니다.
- 그룹화된 비선형 점수 매기기: 무작위 정답에 대한 민감도를 줄이고 모델의 안정성과 견고성을 더 잘 반영합니다.
- 언어적 맥락 지원: 연결된 또는 교차된 자막 옵션을 제공하여 텍스트 모달리티가 추론에 어떻게 기여하는지 테스트합니다.
- 포괄적인 데이터셋: 800개의 동영상과 3,200개의 인간 애너테이션된 질문-답변 쌍을 포함하며, 전문가가 3,300시간 이상의 애너테이션 작업을 통해 제작했습니다.
- 유연한 평가 파이프라인: VLMEvalKit, lmms-eval, EvalScope와의 통합을 지원하며, 독립적인 Transformers 기반 스크립트도 사용 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트