FineVideo 데이터셋 릴리스
Hugging Face는 고품질의 주석이 달린 비디오 데이터가 부족한 문제를 해결하기 위해 오픈소스 데이터셋인 FineVideo를 소개했습니다. FineVideo는 43,000개의 비디오(총 3,400시간)로 구성되어 있으며, 서술형 내러티브, 씬 구분, QA 쌍 등 풍부한 메타데이터를 포함하고 있어 멀티모달 LLM, 비디오 디퓨전 모델, 컴퓨터 비전 분류기 학습에 중요한 자원입니다.
데이터셋 구성 및 출처
FineVideo는 CC-By 라이선스가 적용된 콘텐츠 모음인 YouTube-Commons에서 수집한 190만 개의 영어 비디오라는 방대한 초기 풀에서 파생되었습니다. 데이터 품질을 보장하기 위해 여러 단계의 필터링 과정을 거쳤습니다:
- Initial Filtering: 데이터셋을 영어 비디오와 트랜스크립트로 제한하고, 해상도, 조회수, 자막 등 메타데이터를 수집했습니다.
- Downloading: 180만 개의 비디오를 클라우드 배치 작업(
ytdlp와 S3 사용)과video2dataset을 결합하여 성공적으로 다운로드했습니다. - Dynamic Content Filtering: 데이터셋에 정적인 이미지나 화면 녹화가 아닌 동적인 콘텐츠가 포함되도록 Hugging Face는 두 가지 필터를 적용했습니다:
- Word Density: 자막의 초당 단어 수가 0.5 이하인 비디오를 제거하여 오디오의 역동성을 확보했습니다.
- Visual Dynamism: FFMPEG의
freezedetect필터를 높은 노이즈 파라미터와 함께 사용해, 세그먼트 중 40% 이상이 정적인 것으로 식별된 비디오를 제외했습니다.
이러한 필터링 후, 풀은 600,000개의 동적 비디오로 감소했습니다.
비디오 분류 및 분류 체계
다양성을 유지하기 위해 Hugging Face는 126개의 세부 카테고리를 포함하는 맞춤형 다중 레벨 분류 체계를 개발했습니다. 이 분류 체계는 GPT-4o를 활용해 초기 구축한 뒤, 정보 과학자들이 정제했습니다.
비디오는 Llama 3.1 70B를 Text Generation Inference (TGI)로 제공하여 분류했습니다. 팀은 프롬프트에서 기존 YouTube 태그와 카테고리를 제거하면 YouTube 자체 메타데이터에 대한 편향이 감소해 분류 품질이 크게 향상된다는 것을 발견했습니다.
고밀도 주석 파이프라인
FineVideo는 활동, 객체, 내러티브 아크 등을 포함한 타임코드 수준의 메타데이터를 제공합니다. 주석 과정은 대형 모델의 구조화된 출력 제한을 극복하기 위해 두 단계 파이프라인을 사용했습니다:
1. Gemini 1.5 Pro를 활용한 자유 텍스트 생성
Gemini 1.5 Pro를 사용해 등장인물, 씬, 분위기, 내러티브 진행, Q&A 쌍에 대한 상세 설명을 생성했습니다. 품질 유지를 위해 팀은 다음과 같은 제약을 적용했습니다:
- Length Limit: 10분을 초과하는 비디오는 제외했으며, 샘플링 결과 긴 콘텐츠에서는 주석 품질이 크게 떨어지는 것이 확인되었습니다.
- Content Selection: 맞춤 알고리즘을 통해 콘텐츠 카테고리, 사용자 참여(좋아요, 조회수, 댓글) 및 채널 대표성을 균형 있게 조정하여 예산 제한 내에서 최종 4,000시간의 콘텐츠를 선정했습니다.
2. GPT-4o를 활용한 구조화 정렬
엄격한 스키마 제약이 LLM 성능을 저하시킬 수 있기 때문에, 팀은 먼저 자유 텍스트 설명을 생성한 뒤 GPT-4o와 Instructor 라이브러리를 사용해 해당 텍스트를 구조화된 Pydantic 스키마로 파싱했습니다. 이를 통해 Gemini 설명의 풍부함을 유지하면서 최종 데이터셋의 기계 가독성을 확보했습니다.
정밀 정렬 및 품질 관리
시간적 정확성을 보장하기 위해 팀은 "정밀 정렬"을 수행했으며, Gemini 1.5가 제공하는 씬 경계(초당 1프레임으로 비디오를 처리)를 실제 비디오 프레임(보통 25-29fps)과 맞추었습니다. 이 과정은 이상치 필터 역할도 했으며, Gemini가 유용한 데이터를 제공하지 않는 비디오는 제외되었습니다. 앞서 적용한 길이 제한 덕분에 실패율은 미미했으며(0.5% 이하)였습니다.
향후 활용
Hugging Face는 현재 FineVideo를 활용해 멀티모달 LLM을 학습 중이며, 완료 시 모델 가중치와 학습 레시피를 커뮤니티에 공개할 계획입니다.
Sources
- OriginalFineVideo: behind the scenes