TimeScope: 장시간 비디오 대형 멀티모달 모델 이해를 위한 새로운 벤치마크
Hugging Face는 장시간 비디오를 처리할 때 비전-언어 모델(LMM)의 실제 시간 이해도를 측정하도록 설계된 오픈소스 벤치마크인 TimeScope를 출시했습니다. 1분에서 8시간에 이르는 기본 비디오에 짧은 “needle” 클립을 삽입함으로써 TimeScope는 모델이 실제로 사건 순서를 이해하는지, 아니면 단순히 표면적인 시각 검색만 수행하는지를 평가합니다.
시간적 벤치마킹의 필요성
많은 현재 비전-언어 모델들은 수천 프레임을 처리할 수 있는 거대한 컨텍스트 윈도우를 지원한다고 주장합니다. 그러나 Hugging Face는 이러한 주장이 종종 과장된 것이라고 지적합니다. 왜냐하면 학습 데이터는 종종 클립당 256프레임으로 제한되어 있어 비디오 길이가 증가함에 따라 성능이 크게 저하되기 때문입니다.
Video Needle in a Haystack(VideoNIAH)와 같은 기존 벤치마크는 종종 정적 이미지를 needle로 사용하여 시각 검색을 측정하지만 시간적 역학을 측정하지는 못합니다. TimeScope는 5~10초 길이의 짧은 비디오 클립을 needle로 사용함으로써 이 격차를 메우고, 모델이 정적인 프레임을 식별하는 것이 아니라 시간 정보와 움직임을 처리하도록 강제합니다.
TimeScope 벤치마크 설계
TimeScope는 하나 이상의 손수 선정된 짧은 비디오 needle를 긴 기본 비디오(예: 강의나 다큐멘터리)에 삽입하는 “needle-in-a-haystack” 방식을 활용합니다. 이 벤치마크는 세 가지 구체적인 능력을 평가합니다:
1. 국지적 검색
이 작업은 모델이 긴 비디오 내의 특정 짧은 구간을 찾아내고 그에 대한 질문에 답할 수 있는 능력을 테스트합니다. 이 카테고리에서 성공하려면 모델이 needle에서 관련 프레임을 샘플링하여 특정 객체나 사건을 식별해야 합니다.
2. 정보 종합
이 작업은 모델이 비디오 전반에 흩어져 있는 여러 텍스트 기반 needle(예: 화면에 표시된 “비밀 단어”)를 식별하고 올바른 연대순으로 보고하도록 요구합니다. 이는 모델이 전체 타임라인을 스캔하고 상대적 위치를 이해하는 능력을 평가합니다.
3. 세밀한 시간 인식
이 작업은 단일 프레임 샘플링으로는 해결할 수 없는 움직임과 연속성에 초점을 맞춥니다. 모델은 여러 프레임에 걸친 동역학을 인식해야 합니다—예를 들어, 사람이 도끼를 휘두른 횟수를 세는 등—정확한 답을 제공해야 합니다. 이는 긴 컨텍스트 처리가 시간적 충실성을 유지하는지를 탐색합니다.
평가 결과 및 주요 발견
Gemini 2.5-Pro와 다양한 버전의 Qwen 2.5-VL 및 InternVL 2.5를 포함한 주요 비전-언어 모델에 대한 초기 평가에서 몇 가지 중요한 통찰이 드러났습니다:
- 시간적 지평선 제한: 대부분의 모델은 비디오 길이가 증가함에 따라 “성능 절벽”을 경험합니다. Gemini 2.5-Pro는 한 시간 이상 길이의 비디오에서도 높은 정확도를 유지한 유일한 모델이었습니다.
- 파라미터 확장 vs. 시간 능력: 모델 크기를 늘린다고 해서 시간 지평선이 자동으로 확장되는 것은 아닙니다. 예를 들어, Qwen 2.5-VL 3B와 7B, 그리고 InternVL 2.5 모델(2B, 4B, 8B)은 거의 동일한 장시간 비디오 성능 곡선을 보이며 대략 동일한 컨텍스트 길이에서 정체되었습니다.
- 작업별 트레이드오프: 모델은 세 가지 축에서 서로 다른 강점을 보입니다. Qwen 2.5-VL은 정보 종합(OCR 작업)에서 좋은 성능을 보였지만 세밀한 시간 인식(동작 카운팅)에서는 어려움을 겪었습니다.
오픈 소스 제공
TimeScope는 커뮤니티 벤치마킹 및 모델 개선을 장려하기 위해 완전히 오픈소스로 제공됩니다. 다음 리소스를 이용할 수 있습니다:
- 데이터셋: Hugging Face의
Apollo-LMMs/TimeScope에 호스팅되어 있습니다. - 리더보드:
Apollo-LMMs/TimeScopeHugging Face Space를 통해 이용 가능합니다. - 평가 프레임워크:
lmms-evalGitHub 저장소에 통합되어 있습니다.
SUMMARY: Hugging Face는 1분에서 8시간에 이르는 콘텐츠에 삽입된 비디오 needle를 사용하여 비전-언어 모델의 시간 이해도를 평가하는 오픈소스 벤치마크인 TimeScope를 소개합니다.
TITLE: TimeScope: 장시간 비디오 대형 멀티모달 모델 이해를 위한 새로운 벤치마크