Vchitect/VBench

[CVPR2024 Highlight] VBench - We Evaluate Video Generation

VBench – 视频生成模型的基准测试套件

什么是它? VBench(及其扩展版本 VBench++ 和 VBench-2.0)是一个开源评估框架,用于现代视频生成 AI。它提供了一个统一的代代码库,让研究人员和开发者可以自动对生成的视频在大量且定义明确的质量维度上进行评分。

为什么它很重要 视频转文本模型的性能已呈爆炸式增长,但目前还没有单一、公认的方法来衡量输出质量。VBench 通过将“视频生成质量”分解为层级化的评估维度(例如:主体一致性、时间性闪烁、运动平滑度、美学质量、可信度、内在忠实度等)并提供以下内容来解决此问题:

  • 提示词套件 – 为每个维度和内容类别精心挑选的文本提示词。
  • 评估方法套件 – 自动计算每个维度分数指标和管道。
  • 人类对齐的评分 – 一个验证层,显示自动评分与人类感知的优劣一致。
  • 排行榜与竞技场 – 公开的 Hugging Face spaces,研究人员可以在其中上传结果、查看采样视频,并比较模型。

关键组件

组件 涵盖内容 在 repo 中的位置
VBench (原始版本) 16 个文本转视频维度(主体一致性、背景一致性、时间性闪烁、运动平滑度、动态程度、美学质量、成像质量、物体类別, 多物体, 人类动作, 颜色, 空间关系, 场景, 时间风格, 外观风格, 整体一致性) . (root)
VBench++ 扩展 VBench,包含:
VBench-I2V – 图像转视频评估
VBench-Long – 针对长视频(如 Sora 风格)的指标
VBench-Trustworthiness – 公平性、偏见、安全性检查
vbench2_beta_i2v, vbench2_beta_long, vbench2_beta_trustworthiness
VBench-2.0 新增内在忠实度维度(常识推理、物理真实感、人类动作、创意构图等)– 5 个大类,18 个细粒度能力 VBench-2.0

如何开始使用

  1. 安装 (建议使用 Python 3.9+) – 套件可在 PyPI 上取得:
    pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118   # pick the CUDA version you need
    pip install vbench
    
  2. 选择一个基准测试 – 导入对應的类別 (e.g., VBench, VBenchI2V, VBenchLong, VBenchTrustworthiness, 或 VBench-2.0 套件) 并指向一个存放生成视频的文件夹。
  3. 运行评估 – 单次调用即可计算所选维度的所有指标,并返回一个分数字典。该库也提供用于可视化雷达图和与公开排行榜进行比较的工具。
  4. 提交结果 – 将您的分数(或生成的视频)上传到 README 中链接的 Hugging Face “VBench Arena” spaces,查看您的模型在已列出的 ~40 多种模型中的排名。

资源与社区

  • 论文:CVPR 2024 (VBench) 和 TPAMI 2025 (VBench++) – 都在 README 中链接了。
  • 排行榜与视频竞技场:VBench, VBench-I2V, VBench-2.0 等的 Hugging Face spaces。
  • 数据集:一个包含基准测试所用所有采样视频的 Google-Drive 文件夹(下载链接在 README 中)。
  • 引用:每个版本都提供了 BibTex 条目;使用基准测试时请引用相应的论文。

谁应该使用它?

  • 开发新 T2V, I2V 或长视频生成模型的研究人员。
  • 需要客观质量报告的商业视频生成服务工程师。
  • 对视频生成公平性、偏见和安全性进展感兴趣的任何人。

以上信息直接取自于 repository 的 README;未添加任何外部假设。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目