CinePile 2.0 发布:对抗性细化提升视频问答数据集质量

TL;DR

CinePile 2.0 是对长视频问答数据集的重大升级,使用对抗性细化流水线将薄弱或退化的 QA 对转化为高质量、依赖视觉的问题,发布中包含完整的流水线代码以及更新的基准,显示出商业和开源视频‑LLM 的显著提升。

什么是 CinePile?

CinePile 是一个长视频 QA 数据集,构建自 YouTube 电影片段和为视障人士提供的音频描述。原始的 2024 年 5 月发布包含约 30 万训练样本和 5 千测试样本。它的特点包括:

  • 问题多样性 – 包括时间推理、情节分析、角色动态、场景细节以及主题探索。
  • 问题难度 – 人类标注者在基准上比最佳商业视觉模型高出 25%,比开源模型高出 65%。

数据创建流水线 (CinePile 1.0)

  1. 模板挖掘 – 来自 MovieQA 和 TVQA 的问题使用 UAE‑Large‑V1 相似度模型进行聚类。每个簇随机抽取十个示例,输入 GPT‑4 生成模板和原型问题。
  2. 模板选择 – Gemini 1.0 Pro 为每个片段挑选最相关的模板。
  3. 场景特定生成 – 语言模型接收场景转录、选定的模板名称、示例问题以及系统提示。该提示强制模型使用时间戳并提供推理理由,从而提升答案的可信度和干扰项质量。
  4. 规模 – 每段视频大约生成 32 条问题。
  5. 质量过滤 – 三个大语言模型(Gemini、GPT‑3.5、Phi‑1.5)标记退化问题(答案仅凭问题本身即可显而易见)。Gemini 还对问题是否需要视觉信息进行打分。难度通过在完整上下文下测试模型来衡量。

首次发布的局限性

  • 退化过滤丢弃了许多仍包含有用视频信息的问题。
  • 该过滤仅覆盖测试集,因为在完整训练集上运行多个专有模型成本过高。
  • 某些问题可以在没有任何视觉或对话上下文的情况下回答,削弱了基准对视觉推理的关注。

对抗性细化:将薄弱 QA 转化为强 QA

新的 对抗性细化 流水线用迭代改进取代了直接丢弃:

  1. 聋盲 LLM – 只看到问题和答案选项(没有转录或视觉数据)的模型。CinePile 2.0 使用 LLaMA 3.1 70B 执行此角色。
  2. 推理提取 – 聋盲 LLM 返回答案及文本推理,揭示隐含线索。
  3. 问题修改 – GPT‑4 重写问题和/或答案选项,以消除已识别的线索。
  4. 迭代循环 – 步骤 1‑3 重复最多五次,直至聋盲 LLM 的准确率降至随机水平(≈20 %)。
  5. 鲁棒性检查 – 测试答案顺序的全部五种排列;若模型在三次或以上的排列中成功,则该问题被标记为退化。

对数据集的影响

指标 测试集 训练集
已修复的退化对 90.24 % 90.94 %
不可修复对(人工审查) ~80 of 800 保留(无负面影响)

实现细节

  • 代码发布 – 完整的对抗性细化流水线,包括提示,已在 https://github.com/JARVVVIS/Adversarial-Refinement 开源。
  • 本地执行 – LLaMA 3.1 70B 可在本地运行,避免 API 速率限制和云费用。
  • 提示设计 – 提示引导 GPT‑4 专注于去除隐含线索,而不改变问题的底层语义。

在 CinePile 2.0 上的评估

对修订后的测试集使用先前基准模型和 16 个新视频‑LLM 进行评估。主要发现:

  • Gemini 1.5 Pro 在商业视觉语言模型中领先,尤其在场景与技术分析(环境和角色交互问题)方面。
  • 基于 GPT 的模型叙事与情节分析方面表现出色。
  • Gemini 1.5 Flash 达到 58.75 % 的整体准确率,在场景相关类别表现强劲。

开源模型进展

模型 准确率 显著观察
LLaVa‑One Vision 49.34 % 相较于 Video‑LLaVA 在 CinePile 1.0 上的 22.51 %,实现了大幅跃升
LLaVa‑OV (7B) 与更大的 26 B 模型竞争
MiniCPM‑V 2.6 (8B) 超越 InternVL2(26 B)

难度拆分分析

难度拆分 将需要更深层视觉推理的问题单独划分。所有评估模型的准确率均出现显著下降,凸显当前 AI 系统与人类在复杂视频理解任务上的巨大差距。

排行榜与社区参与

实时的 CinePile 2.0 排行榜(https://huggingface.co/spaces/tomg-group-umd/CinePileLeaderboard)接受新模型提交并持续更新,提供一个透明的平台来跟踪进展。

为什么 CinePile 2.0 很重要

  • 大规模数据集质量 – 对抗性细化展示了一种在无需人工整理的情况下升级现有数据集的实用方法。
  • 基准相关性 – 精炼后的测试集迫使模型依赖视觉信息,使性能提升更具意义。
  • 开源可及性 – 发布流水线和代码使其他研究者能够将相同技术应用于自己的多模态数据集。
  • 社区信号 – 排行榜和改进的开源结果显示出快速进展,但难度拆分的差距仍表明未来研究有广阔空间。

本文作者为 Hugging Face 的 Ruchit Rawal、Miquel Farré、Gowthami Somepalli 和 Leandro von Werra。

Sources