CinePile 2.0 릴리스: 적대적 정제가 비디오 QA 데이터셋 품질을 향상시킵니다
TL;DR
CinePile 2.0은 약하거나 퇴화된 QA 쌍을 고품질의 시각‑종속 질문으로 전환하는 adversarial refinement 파이프라인을 사용하는 장시간 비디오 질문‑답변 데이터셋의 주요 업그레이드이며, 이번 릴리스에는 전체 파이프라인 코드와 상업용 및 오픈소스 비디오‑LLM 모두에서 상당한 향상을 보여주는 최신 벤치마크가 포함됩니다.
CinePile이란?
CinePile은 시각 장애인을 위한 YouTube 영화 클립 및 오디오 설명을 기반으로 만든 장시간 비디오 QA 데이터셋입니다. 원래 2024년 5월 릴리스에는 약 30만 개의 학습 샘플과 5천 개의 테스트 샘플이 포함되었습니다. 다음과 같은 특징이 있었습니다:
- Question diversity – 시간 추론, 플롯 분석, 캐릭터 역학, 설정 세부 사항, 그리고 주제 탐구를 포괄합니다.
- Question difficulty – 인간 주석자는 벤치마크에서 최고의 상업용 비전 모델보다 25 % 더, 오픈소스 모델보다 65 % 더 높은 성능을 보였습니다.
데이터 생성 파이프라인 (CinePile 1.0)
- Template mining – MovieQA와 TVQA의 질문을 UAE‑Large‑V1 유사도 모델로 클러스터링했습니다. 각 클러스터당 무작위 10개의 예시를 GPT‑4에 입력하여 템플릿과 전형적인 질문을 생성했습니다.
- Template selection – Gemini 1.0 Pro가 각 클립에 가장 적합한 템플릿을 선택했습니다.
- Scene‑specific generation – 언어 모델은 씬 전사본, 선택된 템플릿 이름, 예시 질문, 그리고 시스템 프롬프트를 받았습니다. 프롬프트는 모델이 타임스탬프를 사용하고 근거를 제공하도록 강제했으며, 이는 답변의 타당성과 방해 요소의 품질을 향상시켰습니다.
- Scale – 비디오당 약 32개의 질문이 생성되었습니다.
- Quality filters – 세 개의 LLM(Gemini, GPT‑3.5, Phi‑1.5)이 degenerate 질문(질문만으로 답이 명백한)을 표시했습니다. Gemini는 또한 질문이 시각 정보를 필요로 하는지 점수를 매겼습니다. 난이도는 전체 컨텍스트를 사용한 모델 테스트로 측정되었습니다.
첫 번째 릴리스의 제한 사항
- Degeneracy filtering이 여전히 유용한 비디오 정보를 포함한 많은 질문을 삭제했습니다.
- 필터는 전체 학습 세트에 여러 독점 모델을 실행하는 비용이 너무 많이 들어 테스트 분할에만 적용되었습니다.
- 일부 질문은 시각 또는 대화 컨텍스트 없이도 답변할 수 있어 벤치마크가 시각적 추론에 초점을 맞추는 정도가 감소했습니다.
적대적 정제: 약한 QA를 강한 QA로 전환
새로운 adversarial refinement 파이프라인은 즉각적인 삭제를 반복적인 개선으로 대체합니다:
- Deaf‑Blind LLM – 질문과 답변 선택지만 보는 모델(전사본이나 시각 데이터 없음). CinePile 2.0은 이 역할에 LLaMA 3.1 70B를 사용합니다.
- Rationale extraction – Deaf‑Blind LLM은 답변과 텍스트 근거를 반환하여 암시적 단서를 드러냅니다.
- Question modification – GPT‑4는 식별된 단서를 제거하도록 질문 및/또는 답변 옵션을 다시 작성합니다.
- Iterative loop – 단계 1‑3을 최대 다섯 번 반복하여 Deaf‑Blind LLM의 정확도가 무작위 수준(≈20 %)으로 떨어질 때까지 진행합니다.
- Robustness checks – 답변 순서의 다섯 가지 모든 순열을 테스트합니다; 모델이 세 번 이상 성공하면 질문을 degenerate로 표시합니다.
데이터셋에 미치는 영향
| 지표 | 테스트 세트 | 학습 세트 |
|---|---|---|
| 퇴화된 쌍 수정됨 | 90.24 % | 90.94 % |
| 수정 불가능한 쌍 (수동 검토) | ~80 of 800 | 보존 (부정적 영향 없음) |
따라서 파이프라인은 약한 항목의 대부분을 복구하여 귀중한 비디오 콘텐츠를 보존하면서 최종 벤치마크가 실제로 시각적 이해를 요구하도록 보장합니다.
구현 세부 사항
- Code release – 프롬프트를 포함한 전체 적대적 정제 파이프라인이 https://github.com/JARVVVIS/Adversarial-Refinement에서 오픈소스로 제공됩니다.
- Local execution – LLaMA 3.1 70B가 로컬에서 실행되어 API 호출 제한 및 클라우드 비용을 피합니다.
- Prompt design – 프롬프트는 질문의 기본 의미를 변경하지 않고 암시적 단서를 제거하도록 GPT‑4를 안내합니다.
CinePile 2.0 평가
수정된 테스트 세트는 이전에 벤치마크된 모델과 16개의 새로운 비디오‑LLM으로 평가되었습니다. 주요 결과는 다음과 같습니다:
- Gemini 1.5 Pro는 상업용 VLM을 선도하며, 특히 Setting and Technical Analysis (환경 및 캐릭터 상호작용 질문)에서 두드러집니다.
- GPT‑based models는 Narrative and Plot Analysis에서 뛰어납니다.
- Gemini 1.5 Flash는 전체 정확도 58.75 %를 달성했으며, 설정 관련 카테고리에서 강력한 성능을 보였습니다.
오픈소스 모델 진행 상황
| 모델 | 정확도 | 주요 관찰 |
|---|---|---|
| LLaVa‑One Vision | 49.34 % | Video‑LLaVA의 CinePile 1.0에서 22.51 %에서 크게 상승 |
| LLaVa‑OV (7B) | – | 더 큰 26 B 모델와 경쟁력 있음 |
| MiniCPM‑V 2.6 (8B) | – | InternVL2 (26 B)보다 성능 우수 |
최고의 오픈소스 모델조차 hard split에서 정확도가 15‑20 % 감소하며, CinePile 2.0가 시각적 서사 이해에 여전히 도전적인 벤치마크임을 확인합니다.
Hard‑split 분석
hard split은 더 깊은 시각적 추론을 요구하는 질문을 분리합니다. 평가된 모든 모델은 정확도가 크게 떨어져 현재 AI 시스템과 인간 성능 사이에 상당한 격차가 있음을 강조합니다.
리더보드 및 커뮤니티 참여
실시간 CinePile 2.0 리더보드(https://huggingface.co/spaces/tomg-group-umd/CinePileLeaderboard)는 새로운 모델 제출을 받아 지속적으로 업데이트되며, 진행 상황을 추적할 수 있는 투명한 플랫폼을 제공합니다.
CinePile 2.0가 중요한 이유
- Dataset quality at scale – 적대적 정제는 수동 큐레이션 없이 기존 데이터셋을 업그레이드하는 실용적인 방법을 보여줍니다.
- Benchmark relevance – 정제된 테스트 세트는 모델이 시각 정보에 의존하도록 강제하여 성능 향상이 더 의미 있게 만듭니다.
- Open‑source accessibility – 파이프라인과 코드를 공개함으로써 다른 연구자들이 자신의 멀티모달 데이터셋에 동일한 기술을 적용할 수 있게 합니다.
- Community signal – 리더보드와 향상된 오픈소스 결과는 빠른 진전을 보여주지만, hard‑split 격차는 향후 연구를 위한 충분한 여지를 강조합니다.
이 게시물의 저자는 Hugging Face의 Ruchit Rawal, Miquel Farré, Gowthami Somepalli, 그리고 Leandro von Werra입니다.