LAION-AI/CLIP_benchmark

CLIP-like model evaluation

何を解決するか

CLIP Benchmark は、CLIP と同様の(対照的言語-画像事前学習)モデルのパフォーマンスを測定するための標準化された評価フレームワークです。幅広いデータセットとタスクでこれらのモデルを一貫性のある方法でテストできるようにし、再現可能な結果を保証します。

動作方法

このツールは、モデル、データセット、タスクを指定できるコマンドラインインターフェース(CLI)を提供します。事前学習済みモデル(OpenCLIP、Japanese CLIP、NLLB CLIP など)の読み込みと、torchvision、TensorFlow データセット、VTAB、WebDataset などからのデータ読み込みを管理します。結果は JSON ファイルとして出力され、最終的に CSV テーブルに集約できます。

対象ユーザー

視覚言語モデルを扱う AI 研究者や開発者で、既存のベースラインと比較してモデルをベンチマークする必要がある、または複数の言語とデータセットでゼロショットおよび線形プロービングの能力を評価したい人向けです。

特徴

  • 多様なタスク対応: ゼロショット分類、ゼロショット検索、線形プロービング、キャプション生成をサポート。
  • 広範なモデル互換性: OpenCLIP、Japanese CLIP、NLLB CLIP に対応。カスタム CLIP モデルの追加も明確な道筋を提供。
  • 多言語評価: Babel ImageNet や Crossmodal-3600 などのデータセットを用いて、数十の言語でのモデル評価を広くサポート。
  • 豊富なデータセット統合: torchvision、TensorFlow データセット、VTAB と統合。Hugging Face Hub を通じたリモート読み込みもサポート。
  • 合成性テスト: Sugar Crepe と Winoground を用いた合成性タスクの特定評価を含む。
  • バッチ処理: テンプレートやリストファイルを使用して、複数のモデル、複数のデータセット、複数の言語を同時に評価できる機能。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト