CinePile 2.0 發布:對抗式精煉提升影片問答資料集品質
TL;DR
CinePile 2.0 是長影片問答資料集的重大升級,使用 對抗式精煉 流程將薄弱或退化的 QA 配對轉換為高品質、依賴視覺的問題,且此發布包含完整的流程程式碼以及更新的基準測試,顯示商業與開源影片大型語言模型皆有顯著提升。
CinePile 是什麼?
CinePile 是一個長影片問答資料集,取材自 YouTube 電影剪輯與為視障人士提供的音訊說明。原始的 2024 年 5 月發布包含約 30 萬筆訓練樣本與 5 千筆測試樣本。其特色包括:
- 問題多樣性 – 包含時間推理、情節分析、角色動態、場景細節與主題探索。
- 問題難度 – 人類標註者在基準測試中比最佳商業視覺模型高出 25%,比開源模型高出 65%。
資料建立流程 (CinePile 1.0)
- 模板挖掘 – 來自 MovieQA 與 TVQA 的問題使用 UAE‑Large‑V1 相似度模型進行聚類。每個聚類隨機抽取十個範例,送入 GPT‑4 產生模板與典型問題。
- 模板選擇 – Gemini 1.0 Pro 為每段剪輯挑選最相關的模板。
- 情境特定生成 – 語言模型接收情境文字稿、選定的模板名稱、範例問題與系統提示。此提示迫使模型使用時間戳記並提供推理,提升答案的可信度與干擾項品質。
- 規模 – 每支影片大約產生 32 個問題。
- 品質過濾 – 三個大型語言模型(Gemini、GPT‑3.5、Phi‑1.5)標記 退化 問題(答案僅從問題本身即可推斷)。Gemini 亦評分問題是否需要視覺資訊。難度透過在完整上下文下測試模型來衡量。
首次發布的限制
- 退化過濾捨棄了許多仍含有有用影片資訊的問題。
- 此過濾僅涵蓋測試集,因為在完整訓練集上執行多個專有模型成本過高。
- 某些問題可在無視覺或對話上下文的情況下回答,降低了基準測試對視覺推理的聚焦。
對抗式精煉:將薄弱 QA 轉化為強大 QA
新的 對抗式精煉 流程以迭代改進取代直接捨棄:
- 失聰盲 LLM – 只看到問題與答案選項(無文字稿或視覺資料)的模型。CinePile 2.0 為此使用 LLaMA 3.1 70B。
- 推理抽取 – 失聰盲 LLM 回傳答案與文字推理,揭露隱含線索。
- 問題修改 – GPT‑4 重新撰寫問題與/或答案選項,以消除已辨識的線索。
- 迭代循環 – 步驟 1‑3 重複最多五次,直至失聰盲 LLM 的正確率下降至隨機機率(≈20 %)。
- 魯棒性檢查 – 測試答案順序的全部五種排列;若模型在三種或以上排列中成功,則將問題標記為退化。
對資料集的影響
| 指標 | 測試集 | 訓練集 |
|---|---|---|
| 已修復的退化配對 | 90.24 % | 90.94 % |
| 無法修復的配對(手動審查) | ~80 of 800 | 保留(無負面影響) |
因此,此流程挽救了大多數薄弱項目,保留有價值的影片內容,同時確保最終基準測試真正需要視覺理解。
實作細節
- 程式碼發布 – 完整的對抗式精煉流程(含提示)已於 https://github.com/JARVVVIS/Adversarial-Refinement 開源。
- 本機執行 – LLaMA 3.1 70B 可在本機運行,避免 API 速率限制與雲端成本。
- 提示設計 – 提示引導 GPT‑4 專注於移除隱含線索,且不改變問題的底層語意。
CinePile 2.0 評估
修訂後的測試集使用先前已基準測試的模型以及 16 個新影片大型語言模型進行評估。主要發現:
- Gemini 1.5 Pro 在商業視覺語言模型中領先,尤其在 場景與技術分析(環境與角色互動問題)方面。
- 基於 GPT 的模型 在 敘事與情節分析 上表現優異。
- Gemini 1.5 Flash 總體正確率達 58.75%,在與場景相關的類別上表現強勁。
開源模型進展
| 模型 | 正確率 | 顯著觀察 |
|---|---|---|
| LLaVa‑One Vision | 49.34 % | 從 Video‑LLaVA 在 CinePile 1.0 的 22.51 % 大幅提升 |
| LLaVa‑OV (7B) | – | 與較大 26 B 模型具競爭力 |
| MiniCPM‑V 2.6 (8B) | – | 超越 InternVL2(26 B) |
即使是最佳的開源模型,在 hard split 上也會失去 15‑20 % 的正確率,證實 CinePile 2.0 仍是視覺敘事理解的具挑戰性基準。
Hard‑split 分析
hard split 將需要更深入視覺推理的問題分離出來。所有評估的模型皆顯示出明顯的正確率下降,凸顯當前 AI 系統與人類在複雜影片理解任務上的巨大差距。
排行榜與社群參與
即時的 CinePile 2.0 排行榜 (https://huggingface.co/spaces/tomg-group-umd/CinePileLeaderboard) 接受新模型提交並持續更新,提供透明的平台以追蹤進展。
為何 CinePile 2.0 重要
- 大規模資料集品質 – 對抗式精煉展示了一種在不需人工整理下升級現有資料集的實用方法。
- 基準相關性 – 精煉後的測試集迫使模型依賴視覺資訊,使效能提升更具意義。
- 開源可及性 – 發布流程與程式碼讓其他研究者能將相同技術套用於自己的多模態資料集。
- 社群訊號 – 排行榜與改進的開源結果顯示快速進展,然而 hard‑split 的差距仍顯示未來研究有大量空間。
本文作者為 Hugging Face 的 Ruchit Rawal、Miquel Farré、Gowthami Somepalli 與 Leandro von Werra。