google-deepmind/physics-IQ-benchmark

Benchmarking physical understanding in generative video models

Physics‑IQ 與 Physics‑IQ Verified – 生成式影片模型的基準測試

是什麼 – 一個高品質的實世界影片資料集(4K @ 30 fps),捕捉了多種物理現象(碰撞、流體、重力、磁力、光等)從三個攝影機角度拍攝,並為每個情境錄製兩次。該倉儲提供了兩個版本基準測試的 評估工作流程

  • Physics‑IQ – 原始發布版本。
  • Physics‑IQ Verified – 改進版本,具有更好的提示詞、遮罩與評分(推薦使用)。

為何重要 – 生成式影片模型(文字到影片、影片到影片等)日益強大,但目前尚無標準方法來測試其生成的影片是否遵循物理定律。該基準測試提供了一個現實的測試集與可重現的評分流程,使模型之間的公平比較成為可能。

如何使用

  1. 下載資料 – 從 Hugging Face 倉儲(Anates‑Labs‑Research/Physics‑IQ‑Verified)下載資料。資料集包含:
    • full‑videos/ – 原始的5秒片段。
    • split‑videos/testing/ – 用於V2V模型的條件部分與目標部分分割後的相同片段。
    • switch‑frames/ – 用於I2V模型的種子單幀影像。
    • video‑masks/real/ – 評分指標所需的真值遮罩。
  2. 設定環境 – 使用現代工具 uvuv sync)或 pip(pip install .)。需要 Linux + ffprobe
  3. 選擇提示模板 – 該基準測試支援兩種提示風格:
    • bpp(best‑practice‑prompt) – 由 descriptions/best_practice/ 中的模板產生器生成的模型特定提示。
    • op(original prompt) – 原始資料集中的原始提示。 可透過 uv run physiq/generate_descriptions.py <model_name> 為自訂模型生成新的CSV。
  4. 生成影片
    • I2V模型:將 switch‑frames/ 中的單幀影像與選定的描述CSV輸入。
    • V2V模型:將 split‑videos/conditioning‑videos/ 中的條件影片(可選地加上描述CSV)輸入。 將每個輸出影片以基準ID前綴(0001_… .mp4)儲存。
  5. 組織執行 – 為每個模型執行建立一個名為 <model>-<prompt_setting>-run_<01‑04> 的資料夾。建議進行四次獨立執行,以獲得統計上可靠的排行榜分數。
  6. 裁剪為5秒 – 在評估前確保每個生成的片段恰好為5秒。
  7. 執行評分器 – 執行 physiq/run_physics_iq.py(或等效入口點)。該腳本將您的影片與真值遮罩進行比較,並返回百分比分數(100 % = 完美的物理真實性)。
  8. 提交至排行榜 – 若希望顯示您的結果,請透過拉取請求向Markdown表格中新增一列。

排行榜 – README 列出目前分數(例如,Magi‑1 24B + GeoPhys ≈ 在Verified基準上為58 %,Cosmos3‑Super ≈ 39 %)。分數以四次執行的平均值 ± 標準差報告。

引用與授權 – 本專案採用寬鬆授權(參見 License 部分),並要求使用者在發表結果時引用附帶的arXiv報告。


總結 – Physics‑IQ Verified 為研究人員提供了一套即用型的實世界影片套件與可重現的評估腳本,用以衡量生成式影片模型對物理定律的理解與尊重程度。它是AI生成影片領域中真正且面向社群的基準測試。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案