LAION-AI/CLIP_benchmark

CLIP-like model evaluation

解决的问题

CLIP Benchmark 是一个标准化的评估框架,旨在衡量 CLIP 类(对比语言-图像预训练)模型的性能。它提供了一种统一的方法,可在多种多样的数据集和任务上测试这些模型,以确保结果的一致性和可复现性。

如何工作

该工具提供命令行界面(CLI),允许用户指定模型、数据集和任务。它负责加载预训练模型(如 OpenCLIP、Japanese CLIP 和 NLLB CLIP),并管理来自 torchvision、TensorFlow 数据集、VTAB 和 WebDataset 等多种来源的数据加载。结果以 JSON 文件形式输出,随后可聚合为最终的 CSV 表格。

适用人群

从事视觉-语言模型研究与开发的 AI 研究人员和开发者,需要将模型与现有基线进行对比,或在多种语言和数据集上评估其零样本和线性探测能力。

主要亮点

  • 多样任务支持:支持零样本分类、零样本检索、线性探测和图像描述生成。
  • 广泛模型兼容性:支持 OpenCLIP、Japanese CLIP 和 NLLB CLIP,且为添加自定义 CLIP 模型提供了清晰路径。
  • 多语言评估:通过 Babel ImageNet 和 Crossmodal-3600 等数据集,广泛支持数十种语言的模型评估。
  • 丰富数据集集成:与 torchvision、TensorFlow 数据集、VTAB 集成,并支持通过 Hugging Face Hub 进行远程加载。
  • 组合性测试:包含使用 Sugar Crepe 和 Winoground 的组合性任务专项评估。
  • 批量处理:支持使用模板或列表文件,同时对多个模型、多个数据集和多种语言进行评估。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目