mlfoundations/open_clip

An open source implementation of CLIP.

解決する課題

OpenCLIP は OpenAI の CLIP(Contrastive Language-Image Pre-training)のオープンソース実装であり、画像とテキストの関係を理解できる大規模モデルをトレーニングして使用するためのフレームワークを提供します。研究者や開発者は、LAION や DataComp のような大規模なデータセットでトレーニングされた多種多様な事前学習済みモデルにアクセスできるため、リソースを大量に消費するこれらのモデルをゼロからトレーニングする必要がなくなります。

仕組み

このプロジェクトは、画像エンコーダーとテキストエンコーダーをトレーニングし、画像とそれに対応するキャプションを共有の埋め込み空間にマッピングする対照学習アプローチを実装しています。これにより、システムは特定の画像が特定のテキストとどの程度一致しているかを判断できます。このライブラリは、Vision Transformers (ViT) や ConvNext などのさまざまなアーキテクチャをサポートしており、画像エンコーダー用の timm やトークナイザー用の Hugging Face などのツールと統合されています。

対象者

AI 研究者、機械学習エンジニア、およびゼロショット画像分類、画像とテキストの検索、またはマルチモーダル理解を必要とするアプリケーションを構築する開発者向けに設計されています。

ハイライト

  • 広範な事前学習済みライブラリ: LAION-2B や DataComp-1B などのデータセットでトレーニングされた、ImageNet でのゼロショット精度が高い多数のモデルにアクセスできます。
  • 多様なモデルファミリー: CLIP、SigLIP、CoCa、MaMMUT、および NaFlex(可変解像度の画像と音声)などの新しい実験的アーキテクチャをサポートしています。
  • 高度なトレーニングスタック: トレーニング効率を最適化するための FSDP2、torch.compile ストラテジー、および長さバケットtingのサポートが含まれています。
  • マルチモーダル拡張: 画像だけでなく、音声-テキスト対照学習 (CLAP) や生成的キャプショニング (GenLIP/GenLAP) をサポートしています。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • Dispatch
  • Dispatch