Hugging Face 비디오 데이터셋 스크립트
허깅 페이스는 비디오 생성 모델을 위한 고품질 훈련 데이터 생성을 표준화하기 위해 오픈 비디오 데이터셋 스크립트 모음을 출시했습니다. 이 도구는 이미지 생성에 현재 존재하는 동일한 수준의 확립된 인프라를 비디오 데이터셋에 제공하려고 하며, 대규모 애플리케이션을 위해 소규모 맞춤 스크립트와 video2dataset를 결합합니다.
3단계 비디오 데이터 파이프라인
비디오 데이터셋 파이프라인은 획득, 전처리/필터링, 처리라는 세 가지 distinct 단계로 구성됩니다. 이 아키텍처는 Stable Video Diffusion과 LTX-Video에서 사용되는 데이터 파이프라인에서 영감을 얻었습니다.
단계 1: 획득
획득은 비디오 콘텐츠를 다운로드하기 위해 yt-dlp에 의존합니다. 장형 콘텐츠를 처리하기 위해 파이프라인은 긴 비디오를 짧고 관리 가능한 클립으로 나누는 "Video to Scenes" 스크립트를 포함합니다.
단계 2: 전처리 및 필터링
필터링은 데이터 품질과 안전성을 보장하기 위해 프레임 및 비디오 레벨 모두에 적용됩니다:
- 프레임 수준 필터링:
- 워터마크 감지:
LAION-5B-WatermarkDetection을 사용하여 워터마크가 있는 콘텐츠를 식별합니다. - 미적 점수:
improved-aesthetic-predictor을 사용하여 프레임에 품질 점수를 할당합니다. - NSFW 감지:
Falconsai/nsfw_image_detection을 사용하여 부적절한 콘텐츠를 필터링합니다.
- 워터마크 감지:
- 비디오 수준 필터링:
- 모션 점수: OpenCV를 사용하여 전체 비디오 클립 내의 모션 양을 예측합니다.
단계 3: 처리
처리는 클립에 대한 설명적 메타데이터 생성을 중점으로 합니다. 파이프라인은 추출된 프레임에서 여러 작업을 수행하기 위해 microsoft/Florence-2-large를 활용하며, 여기에는 <CAPTION>, <DETAILED_CAPTION>, <DENSE_REGION_CAPTION>, <OCR_WITH_REGION>이 포함됩니다.
While Florence-2 is the default for frame-level captioning, the pipeline is flexible. Other captioners can be integrated, and entire videos can be captioned using models such as Qwen2.5-VL instead of individual frames.
필터링 인사이트 및 벤치마크
제한적인 필터를 적용하면 데이터셋 크기를 크게 줄이면서 품질을 높일 수 있습니다. finetrainers/crush-smol 데이터셋을 생성할 때, 허깅 페이스는 Qwen2VL 캡션을 사용하고 pwatermark < 0.1 및 aesthetic > 5.5로 필터링했습니다. 이 과정을 통해 총 1,493개의 비디오가 47개로 줄어들었습니다.
워터마크 및 미적 점수 필터링 관찰
- 워터마크 감지:
pwatermark점수는 텍스트 감지에 효과적이지만, 워터마크 오버레이와 장면 내 텍스트(예: 장난감 자동차의 번호판)를 구분할 수 없습니다. 허깅 페이스는 프레임 간 평균 점수를 사용하고 임계값을 0.2 - 0.3으로 설정하는 것이 모든 프레임을 엄격한 임계값 이하로 요구하는 것보다 더 효과적이라고 제안합니다. - 미적 점수: 높은 미적 임계값(예: > 5.5)은 편향을 도입할 수 있으며, 잠재적으로 유용한 데이터를 필터링할 수 있습니다. 저자들은 미적 점수가 "완벽한" 콘텐츠를 찾는 도구가 아니라 "불량 콘텐츠" 필터로 최소 임계값 4.25 - 4.5를 사용하는 것이 더 효과적이라고 언급합니다.
실제 적용: CogVideoX-5B 파인튜닝
이 스크립트의 유용성을 보여주기 위해, 허깅 페이스는 두 개의 특수 데이터셋인 Cakeify와 Crush를 만들었습니다. 이러한 데이터셋은 finetrainers 라이브러리를 사용하여 CogVideoX-5B 모델을 파인튜닝하는 데 사용되었습니다.
One resulting model, finetrainers/crush-smol-v0, can generate videos of objects being flattened by a hydraulic press based on detailed text prompts, such as a red candle being crushed into a flat shape on a metal platform.