LAION-AI/CLIP_benchmark
CLIP-like model evaluation
解決的問題
CLIP Benchmark 是一個標準化的評估框架,旨在衡量 CLIP 類(對比語言-影像預訓練)模型的效能。它提供了一種統一的方法,可在多樣的資料集與任務上測試這些模型,以確保結果的一致性與可重現性。
如何運作
該工具提供命令列介面(CLI),允許使用者指定模型、資料集與任務。它負責載入預訓練模型(如 OpenCLIP、Japanese CLIP 和 NLLB CLIP),並管理來自 torchvision、TensorFlow 資料集、VTAB 和 WebDataset 等多種來源的資料載入。結果以 JSON 檔案形式輸出,隨後可聚合為最終的 CSV 表格。
適用對象
從事視覺-語言模型研究與開發的 AI 研究人員與開發者,需要將模型與現有基線進行對比,或在多種語言與資料集上評估其零樣本與線性探測能力。
主要亮點
- 多樣任務支援:支援零樣本分類、零樣本檢索、線性探測與影像描述生成。
- 廣泛模型相容性:支援 OpenCLIP、Japanese CLIP 與 NLLB CLIP,並為新增自訂 CLIP 模型提供清晰路徑。
- 多語言評估:透過 Babel ImageNet 與 Crossmodal-3600 等資料集,廣泛支援數十種語言的模型評估。
- 豐富資料集整合:與 torchvision、TensorFlow 資料集、VTAB 整合,並支援透過 Hugging Face Hub 進行遠端載入。
- 組合性測試:包含使用 Sugar Crepe 與 Winoground 的組合性任務專項評估。
- 批次處理:支援使用範本或清單檔案,同時對多個模型、多個資料集與多種語言進行評估。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案