FineVideo 数据集发布
Hugging Face 推出了 FineVideo,这是一套开源数据集,旨在解决高质量、带注释的视频数据稀缺的问题。FineVideo 包含 43,000 条视频,总计 3,400 小时,拥有丰富的元数据,包括描述性叙事、场景划分和问答对,成为训练多模态大语言模型、视频扩散模型和计算机视觉分类器的关键资源。
数据集组成与来源
FineVideo 来源于一个庞大的初始池,包含 190 万个来自 YouTube-Commons 的英文视频,后者是 CC-By 许可内容的集合。策划过程包括多个过滤阶段,以确保数据质量:
- 初始过滤:将数据集缩小至英文视频及其转录稿,收集分辨率、观看次数和字幕等元数据。
- 下载:使用云批处理作业(通过
ytdlp和 S3)以及video2dataset的组合,成功下载了 180 万个视频。 - 动态内容过滤:为确保数据集包含活跃内容而非静态图像或屏幕录制,Hugging Face 应用了两个过滤器:
- 词密度:删除字幕中每秒少于 0.5 个词的视频,以确保音频的动态性。
- 视觉动态性:使用 FFMPEG 的
freezedetect过滤器并设置高噪声参数,剔除超过 40% 段落被识别为静态的视频。
经过这些过滤后,池子被缩减至 60 万个动态视频。
视频分类与分类体系
为保持多样性,Hugging Face 开发了一个包含 126 个细分类别的自定义多层分类体系。该体系通过 GPT-4o 引导创建,并由信息科学家进行细化。
视频使用通过 Text Generation Inference (TGI) 提供的 Llama 3.1 70B 进行分类。团队发现,从提示中移除现有的 YouTube 标签和类别显著提升了分类质量,因为这降低了对 YouTube 自身元数据的偏倚。
高密度注释流水线
FineVideo 提供时间码级别的元数据,包括活动、对象和叙事弧线。注释过程采用两步流水线,以克服大型模型在结构化输出方面的限制:
1. 使用 Gemini 1.5 Pro 进行自由文本生成
使用 Gemini 1.5 Pro 生成角色、场景、情绪、叙事进展以及问答对的详细描述。为保持质量,团队实施了以下约束:
- 时长限制:长度超过 10 分钟的视频被剔除,因为抽样显示较长内容的注释质量显著下降。
- 内容选择:自定义算法在内容类别、用户互动(点赞、观看、评论)和频道代表性之间进行平衡,以在预算限制内挑选出最终 4,000 小时的内容。
2. 使用 GPT-4o 进行结构化对齐
由于严格的模式约束常常降低大语言模型的性能,团队首先生成自由文本描述,然后使用 Instructor 库配合 GPT-4o 将文本解析为结构化的 Pydantic 模式。这既保证了 Gemini 描述的丰富性,又保持了最终数据集的机器可读性。
精细对齐与质量控制
为确保时间准确性,团队执行了“精细对齐”,将 Gemini 1.5 提供的场景边界(其以每秒 1 帧的速率处理视频)匹配到视频的实际帧率(通常为 25-29 fps)。该过程亦充当异常过滤器;若 Gemini 停止提供有用数据的视频会被剔除。由于之前的时长限制,失败率极低(低于 0.5%)。
未来应用
Hugging Face 正在使用 FineVideo 训练多模态大语言模型,并计划在完成后向社区发布模型权重和训练配方。
Sources
- OriginalFineVideo: behind the scenes