Vchitect/VBench

[CVPR2024 Highlight] VBench - We Evaluate Video Generation

VBench – 影片生成模型的基準測試套件

什麼是它? VBench(及其擴展版本 VBench++ 和 VBench-2..0)是一個針對現代影片生成 AI 的開源評估框架。它提供了一個對於研究人員和開發者而言,能自動對生成的影片在大量且定義明確的品質維度上進行評分的核心代碼庫

為什麼它很重要 影片轉文字模型的性能已呈爆炸式增長,但目前還沒有單一且公認的方法來衡量輸出品質。VBench 透過將「影片生成品質」分解為層級化的評估維度(例如:主體一致性、時間性閃爍、運動平滑度、美學品質、可信度、內在忠實度等)並提供以下內容來解決此問題:

  • 提示詞套件 – 為每個維度和內容類別精心挑選的文本提示詞。
  • 評估方法套件 – 自動計算每個維度分數的指標和管道。
  • 符合人體感知的評估分數 – 一個驗證層,顯示自動評分與人類感知的優劣一致。
  • 排行榜與競技場 – 公開的 Hugging Face spaces,研究人員可以在其中上傳結果、查看採樣影片,並比較不同模型。

關鍵組件

組件 涵蓋內容 在 repo 中的位置
VBench (原始版本) 16 個文字轉影片維度(主體一致性、背景一致性、時間性閃爍、運動平滑度、動態程度、美學品質、成像品質、物體類別、多個物體、人類動作、顏色、空間關係、場景、時間風格、外觀風格、整體一致性) . (root)
VBench++ 擴展 VBench,包含:
VBench-I2V – 圖像轉影片評估
VBench-Long – 針對長影片(如 Sora 風格)的指標
VBench-Trustworthiness – 公平性、偏見、安全性檢查
vbench2_beta_i2v, vbench2_beta_long, vbench2_beta_trustworthiness
VBench-2.0 新增內在忠實度維度(常識推理、物理真實感、人類動作、創意構圖等)– 5 個大類,18 個細粒度能力 VBench-2.0

如何開始使用

  1. 安裝 (建議使用 Python 3.9+) – 套件可在 PyPI 上取得:
    pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118   # pick the CUDA version you need
    pip install vbench
    
  2. 選擇一個基準測試 – 導入對應的類別(例如:VBench, VBenchI2V, VBenchLong, VBenchTrustworthiness, 或 VBench-2.0 套件)並指向一個存放生成影片的資料夾。
  3. 執行評估 – 單次調用即可計算所選維度的所有指標,並返回一個分數字典。該函式庫也提供用於視覺化雷達圖和與公開排行榜進行比較的工具。
  4. 提交結果 – 將您的分數(或生成的影片)上傳到 README 中連結的 Hugging Face “VBench Arena” spaces,查看您的模型在已列出的 ~40 多個模型中的排名。

資源與社群

  • 論文:CVPR 2024 (VBench) 和 TPAMI 2025 (VBench++) – 兩者皆連結在 README 中。
  • 排行榜與影片競技場:VBench, VBench-I2V, VBench-2.0 等的 Hugging Face spaces。
  • 數據集:一個包含基準測試所用所有採樣影片的 Google-Drive 資料夾(下載連結在 README 中)。
  • 引用:每個版本皆提供 BibTex 條目;使用基準測試時請引用對應的論文。

誰應該使用它?

  • 開發新 T2V、I2V 或長影片生成模型的研究人員。
  • 需要客觀品質報告的商業影片生成服務工程師。
  • 對於追蹤影片生成公平性、偏見和安全性進展的任何人。

以上資訊直接取自於 repository 的 README;未添加任何外部假設。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案