LAION-AI/CLIP_benchmark

CLIP-like model evaluation

解決的問題

CLIP Benchmark 是一個標準化的評估框架,旨在衡量 CLIP 類(對比語言-影像預訓練)模型的效能。它提供了一種統一的方法,可在多樣的資料集與任務上測試這些模型,以確保結果的一致性與可重現性。

如何運作

該工具提供命令列介面(CLI),允許使用者指定模型、資料集與任務。它負責載入預訓練模型(如 OpenCLIP、Japanese CLIP 和 NLLB CLIP),並管理來自 torchvision、TensorFlow 資料集、VTAB 和 WebDataset 等多種來源的資料載入。結果以 JSON 檔案形式輸出,隨後可聚合為最終的 CSV 表格。

適用對象

從事視覺-語言模型研究與開發的 AI 研究人員與開發者,需要將模型與現有基線進行對比,或在多種語言與資料集上評估其零樣本與線性探測能力。

主要亮點

  • 多樣任務支援:支援零樣本分類、零樣本檢索、線性探測與影像描述生成。
  • 廣泛模型相容性:支援 OpenCLIP、Japanese CLIP 與 NLLB CLIP,並為新增自訂 CLIP 模型提供清晰路徑。
  • 多語言評估:透過 Babel ImageNet 與 Crossmodal-3600 等資料集,廣泛支援數十種語言的模型評估。
  • 豐富資料集整合:與 torchvision、TensorFlow 資料集、VTAB 整合,並支援透過 Hugging Face Hub 進行遠端載入。
  • 組合性測試:包含使用 Sugar Crepe 與 Winoground 的組合性任務專項評估。
  • 批次處理:支援使用範本或清單檔案,同時對多個模型、多個資料集與多種語言進行評估。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案