Hugging Face ビデオデータセットスクリプト
Hugging Face は、ビデオ生成モデルの高品質なトレーニングデータの作成を標準化するため、オープンなビデオデータセットスクリプトのスイートをリリースしました。このツールは、画像生成に現在存在する確立されたインフラストラクチャと同じレベルをビデオデータセットにもたらすことを目的としており、大規模なアプリケーション向けに video2dataset と小規模なカスタムスクリプトを組み合わせます。
三段階ビデオデータパイプライン
ビデオデータセットパイプラインは、取得、前処理/フィルタリング、処理の3つの明確なステージに構造化されています。このアーキテクチャは、Stable Video Diffusion と LTX-Video で使用されているデータパイプラインにインスパイアされています。
ステージ 1: 取得
取得は、ビデオコンテンツのダウンロードに yt-dlp に依存します。長尺コンテンツに対応するため、パイプラインには長いビデオを短く管理可能なクリップに分割する「ビデオからシーンへ」スクリプトが含まれています。
ステージ 2: 前処理とフィルタリング
フレームレベルとビデオレベルの両方でフィルタリングが適用され、データの品質と安全性が確保されます:
- フレームレベルフィルタリング:
- ウォーターマーク検出:
LAION-5B-WatermarkDetectionを使用してウォーターマークが含まれるコンテンツを識別します。
- 美的スコアリング:
improved-aesthetic-predictorを使用してフレームに品質スコアを付与します。
- NSFW検出:
Falconsai/nsfw_image_detectionを使用して不適切なコンテンツをフィルタリングします。
- ウォーターマーク検出:
- ビデオレベルフィルタリング:
- モーションスコアリング:
- OpenCV を使用してビデオクリップ全体のモーション量を予測します。
- モーションスコアリング:
ステージ 3: 処理
処理は、クリップの説明的なメタデータの生成に焦点を当てています。パイプラインは、microsoft/Florence-2-large を使用して抽出されたフレームに対して、<CAPTION>、<DETAILED_CAPTION>、<DENSE_REGION_CAPTION>、および <OCR_WITH_REGION> のいくつかのタスクを実行します。
Florence-2 はフレームレベルのキャプションのデフォルトですが、パイプラインは柔軟です。他のキャプショナーを統合することができ、個々のフレームではなく、Qwen2.5-VL などのモデルを使用してビデオ全体にキャプションを付けることもできます。
フィルタリングの洞察とベンチマーク
制限の厳しいフィルタを適用すると、データセットのサイズを大幅に削減しながら品質を向上させることができます。finetrainers/crush-smol データセットの作成において、Hugging Face は Qwen2VL キャプションを使用し、pwatermark < 0.1 および aesthetic > 5.5 でフィルタリングしました。このプロセスにより、合計 1,493 本のビデオが 47 本に削減されました。
ウォーターマークと美的スコアリングの観察
- ウォーターマーク検出:
pwatermarkスコアはテキストの検出に効果的ですが、ウォーターマークのオーバーレイとシーン内のテキスト(例えば、おもちゃの車のナンバープレート)を区別することはできません。- Hugging Face は、フレーム全体の平均スコアを使用し、0.2 - 0.3 のしきい値を設定する方が、各フレームを厳格なしきい値以下に保つよりも効果的だと示唆しています。
- 美的スコアリング:
- 高い美的スコアのしきい値(例えば、> 5.5)はバイアスをもたらす可能性があり、有用なデータをフィルタリングしてしまうことがあります。
- 著者らは、美的スコアは「完璧」なコンテンツを見つけるツールではなく、最低しきい値 4.25 - 4.5 の「悪いコンテンツ」フィルタとしてより効果的であると指摘しています。
実践的な応用: CogVideoX-5B のファインチューニング
これらのスクリプトの有用性を示すため、Hugging Face は 2 つの専門的なデータセット Cakeify と Crush を作成しました。これらのデータセットは、finetrainers ライブラリを使用して CogVideoX-5B モデルのファインチューニングに使用されました。
その結果得られたモデルの一つ、finetrainers/crush-smol-v0 は、詳細なテキストプロンプトに基づいて、金属のプラットフォーム上で赤いろうそくが平らな形に潰されるなど、油圧プレスによってオブジェクトが平らになるビデオを生成することができます。