FineVideo 資料集發布

Hugging Face 推出了 FineVideo,一個開源資料集,旨在解決高品質、帶標註的影片資料稀缺的問題。FineVideo 包含 43,000 部影片,總時長 3,400 小時,具備豐富的中繼資料,包括敘事描述、場景切分與問答對,成為訓練多模態大型語言模型、影片擴散模型與電腦視覺分類器的關鍵資源。

資料集組成與來源

FineVideo 來源於一個龐大的初始池,包含 190 萬部英語影片,取自 YouTube-Commons(CC-By 授權內容的集合)。資料整理過程經過多個篩選階段,以確保高資料品質:

  • 初始篩選:將資料集縮減為英語影片與文字稿,收集解析度、觀看次數與字幕等中繼資料。
  • 下載:使用雲端批次作業(透過 ytdlp 與 S3)以及 video2dataset 的組合,成功下載了 180 萬部影片。
  • 動態內容篩選:為確保資料集包含動態內容而非靜態圖像或螢幕錄製,Hugging Face 採用了兩項篩選:
    • 詞彙密度:移除字幕每秒少於 0.5 個詞的影片,以確保音訊的動態性。
    • 視覺動態性:使用 FFMPEG 的 freezedetect 濾鏡搭配高噪聲參數,將超過 40% 片段被判定為靜態的影片剔除。

經過這些篩選後,池子縮減至 600,000 部動態影片。

影片分類與分類法

為維持多樣性,Hugging Face 開發了一套自訂的多層級分類法,包含 126 個細分類別。此分類法最初以 GPT-4o 為基礎構建,並由資訊科學家進一步精練。

影片使用透過 Text Generation Inference (TGI) 提供的 Llama 3.1 70B 進行分類。團隊發現,從提示中移除現有的 YouTube 標籤與分類,可顯著提升分類品質,因為減少了對 YouTube 自身中繼資料的偏見。

高密度標註管線

FineVideo 提供時間碼層級的中繼資料,涵蓋活動、物件與敘事弧線。標註流程採用兩階段管線,以克服大型模型在結構化輸出上的限制:

1. 使用 Gemini 1.5 Pro 產生自由文字

Gemini 1.5 Pro 用於產生角色、場景、情緒、敘事進展與問答對的詳細描述。為維持品質,團隊實施了以下限制:

  • 長度限制:超過 10 分鐘的影片會被剔除,因為抽樣顯示較長內容的標註品質顯著下降。
  • 內容選擇:自訂演算法在內容類別、使用者互動(讚、觀看次數、評論)與頻道代表性之間取得平衡,選出最終 4,000 小時的內容,以符合預算限制。

2. 使用 GPT-4o 進行結構化對齊

由於嚴格的結構約束常會削弱 LLM 效能,團隊先產生自由文字描述,然後使用 Instructor 函式庫搭配 GPT-4o 將文字解析為結構化的 Pydantic 架構。這確保了 Gemini 描述的豐富性,同時維持最終資料集的機器可讀性。

精細對齊與品質控制

為確保時間上的準確性,團隊執行了「精細對齊」,將 Gemini 1.5(以每秒 1 幀處理影片)提供的場景邊界對應至影片的實際幀數(通常為 25-29 fps)。此過程同時充當異常過濾;若 Gemini 停止提供有用資料的影片會被剔除。由於先前的長度限制,失敗率可忽略不計(低於 0.5%)。

未來應用

Hugging Face 目前正使用 FineVideo 訓練多模態大型語言模型,並計畫在完成後向社群釋出模型權重與訓練配方。

Sources