FineVideo データセットリリース
Hugging Face は、質の高いアノテーション付きビデオデータの不足に対処するために設計されたオープンソースデータセット、FineVideo を導入しました。FineVideo は 43,000 本のビデオ(合計 3,400 時間)で構成され、記述的なナラティブ、シーン分割、QA ペアなどの豊富なメタデータを備えており、マルチモーダル LLM、ビデオ拡散モデル、コンピュータビジョン分類器のトレーニングに不可欠なリソースです。
データセットの構成と取得元
FineVideo は、CC‑By ライセンスのコンテンツを集めた YouTube‑Commons から取得した、1,900,000 本の英語ビデオという大規模な初期プールから派生しました。キュレーションプロセスは、データ品質を高めるために複数のフィルタリング段階を含んでいます。
- 初期フィルタリング: データセットは英語ビデオとトランスクリプトに絞られ、解像度、再生回数、クローズドキャプションなどのメタデータが収集されました。
- ダウンロード: 1,800,000 本のビデオが、クラウドバッチジョブ(
ytdlpと S3 を使用)とvideo2datasetの組み合わせにより正常にダウンロードされました。 - 動的コンテンツフィルタリング: データセットが静止画像やスクリーンキャストではなく、動的なコンテンツを含むことを保証するため、Hugging Face は 2 つのフィルタを適用しました:
- 単語密度: クローズドキャプションの語数が 1 秒あたり 0.5 未満のビデオは、音声の動的さを確保するために除外されました。
- 視覚的ダイナミズム: FFMPEG の
freezedetectフィルタを高ノイズパラメータで使用し、セグメントの 40% 以上が静止と判定されたビデオは破棄されました。
これらのフィルタ適用後、プールは 600,000 本の動的ビデオに減少しました。
ビデオのカテゴリ分けとタクソノミー
多様性を維持するため、Hugging Face は 126 の細分化されたカテゴリを含むカスタムの多層タクソノミーを開発しました。このタクソノミーは GPT‑4o を用いてブートストラップされ、情報科学者によって洗練されました。
ビデオは、Text Generation Inference(TGI)を介して提供される Llama 3.1 70B を使用してカテゴリ分けされました。チームは、プロンプトから既存の YouTube タグとカテゴリを除外することで、YouTube のメタデータへのバイアスが減少し、カテゴリ分けの品質が大幅に向上することを発見しました。
高密度アノテーションパイプライン
FineVideo は、アクティビティ、オブジェクト、ナラティブアークなど、タイムコードレベルのメタデータを提供します。アノテーションプロセスは、大規模モデルにおける構造化出力の制限を克服するために、2 段階のパイプラインを利用しました:
1. Gemini 1.5 Pro を用いた自由テキスト生成
Gemini 1.5 Pro は、キャラクター、シーン、ムード、ナラティブの進行、Q&A ペアの詳細な記述を生成するために使用されました。品質を維持するため、チームは以下の制約を実装しました:
- 長さ制限: 10 分を超えるビデオは除外されました。サンプリングにより、長尺コンテンツではアノテーション品質が大幅に低下することが判明したためです。
- コンテンツ選択: カスタムアルゴリズムがコンテンツカテゴリ、ユーザーエンゲージメント(いいね、再生回数、コメント)、チャンネルの代表性をバランスさせ、予算制約内で最終的に 4,000 時間のコンテンツを選択しました。
2. GPT‑4o を用いた構造化アラインメント
厳格なスキーマ制約はしばしば LLM の性能を低下させるため、チームはまず自由テキストの記述を生成し、続いて Instructor ライブラリと GPT‑4o を使用してそのテキストを構造化された Pydantic スキーマに解析しました。これにより、Gemini の記述の豊かさを保ちつつ、最終データセットの機械可読性を維持しました。
細部アラインメントと品質管理
時間的な正確性を確保するため、チームは「細部アラインメント」を実施し、Gemini 1.5 が提供するシーン境界(1 秒あたり 1 フレームでビデオを処理)を、実際のビデオフレーム(通常 25〜29 fps)に合わせました。このプロセスは異常フィルタとしても機能し、Gemini が有用なデータの提供を停止したビデオは除外されました。前述の長さ制限により、失敗率はごくわずか(0.5% 未満)でした。
今後の活用
Hugging Face は現在、FineVideo を用いてマルチモーダル LLM のトレーニングを行っており、完了後にモデルの重みとトレーニングレシピをコミュニティに公開する予定です。
Sources
- OriginalFineVideo: behind the scenes