google-deepmind/physics-IQ-benchmark

Benchmarking physical understanding in generative video models

Physics‑IQ 与 Physics‑IQ Verified – 生成式视频模型的基准测试

是什么 – 一个高质量的实世界视频数据集(4K @ 30 fps),捕捉了多种物理现象(碰撞、流体、重力、磁力、光等)从三个摄像机角度拍摄,并为每个场景录制两次。该仓库提供了两个版本基准测试的 评估工作流

  • Physics‑IQ – 原始发布版本。
  • Physics‑IQ Verified – 改进版本,具有更好的提示词、掩码和评分(推荐使用)。

为何重要 – 生成式视频模型(文本到视频、视频到视频等)日益强大,但目前尚无标准方法来测试其生成的视频是否遵循物理定律。该基准测试提供了一个现实的测试集和可复现的评分流程,使模型之间的公平比较成为可能。

如何使用

  1. 下载数据 – 从 Hugging Face 仓库(Anates‑Labs‑Research/Physics‑IQ‑Verified)下载数据。数据集包含:
    • full‑videos/ – 原始的5秒片段。
    • split‑videos/testing/ – 用于V2V模型的条件部分和目标部分分割后的相同片段。
    • switch‑frames/ – 用于I2V模型的种子单帧图像。
    • video‑masks/real/ – 评分指标所需的真值掩码。
  2. 设置环境 – 使用现代工具 uvuv sync)或 pip(pip install .)。需要 Linux + ffprobe
  3. 选择提示模板 – 该基准测试支持两种提示风格:
    • bpp(best‑practice‑prompt) – 由 descriptions/best_practice/ 中的模板生成器生成的模型特定提示。
    • op(original prompt) – 原始数据集中的原始提示。 可通过 uv run physiq/generate_descriptions.py <model_name> 为自定义模型生成新的CSV。
  4. 生成视频
    • I2V模型:将 switch‑frames/ 中的单帧图像与选定的描述CSV输入。
    • V2V模型:将 split‑videos/conditioning‑videos/ 中的条件视频(可选地加上描述CSV)输入。 将每个输出视频以基准ID前缀(0001_… .mp4)保存。
  5. 组织运行 – 为每个模型运行创建一个名为 <model>-<prompt_setting>-run_<01‑04> 的文件夹。建议进行四次独立运行,以获得统计上可靠的排行榜分数。
  6. 裁剪为5秒 – 在评估前确保每个生成的片段恰好为5秒。
  7. 运行评分器 – 执行 physiq/run_physics_iq.py(或等效入口点)。该脚本将您的视频与真值掩码进行比较,并返回百分比分数(100 % = 完美的物理真实性)。
  8. 提交至排行榜 – 若希望显示您的结果,请通过拉取请求向Markdown表格中添加一行。

排行榜 – README列出了当前分数(例如,Magi‑1 24B + GeoPhys ≈ 在Verified基准上为58 %,Cosmos3‑Super ≈ 39 %)。分数以四次运行的平均值 ± 标准差报告。

引用与许可 – 该项目采用宽松许可(参见 License 部分),并要求用户在发表结果时引用附带的arXiv报告。


总结 – Physics‑IQ Verified 为研究人员提供了一个即用型的实世界视频套件和可复现的评估脚本,用于衡量生成式视频模型对物理定律的理解与尊重程度。它是AI生成视频领域中一个真正且面向社区的基准测试。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目