facebookresearch/MetaCLIP

NeurIPS 2025 Spotlight; ICLR2024 Spotlight; CVPR 2024; EMNLP 2024

何を解決するか

Meta CLIPは、英語中心の対照的言語-画像事前学習(CLIP)モデルの限界に対処します。特に、大規模な非英語データのキュレーションパイプラインの欠如と、「多言語の呪い」、すなわち複数の言語を追加すると英語の性能が英語専用モデルよりも低下するという問題に取り組んでいます。

仕組み

Meta CLIPは、CLIPを世界規模のデータにスケーリングする包括的なレシピを提供します。これには、専門的なデータキュレーション、モデリング、トレーニング戦略が含まれ、英語と非英語データが互いに恩恵を及ぼし合い、性能を向上させることで、最先端の多言語性能を達成します。

対象ユーザー

画像とテキストを幅広いグローバル言語で理解する必要がある、マルチモーダルAIを開発する研究者や開発者向けに設計されています。

主な特徴

  • 世界規模のスケーリング: 英語と多言語機能のパフォーマンスのトレードオフを克服し、グローバルデータにCLIPをスケーリングします。
  • 広範なモデルズー: Meta CLIP 1およびMeta CLIP 2を含む、さまざまなViTアーキテクチャ(S, M, B, L, H, bigG)と解像度の豊富な事前学習済みモデルを提供します。
  • 蒸留モデル: より効率的なデプロイメントを可能にするMeta CLIP 2の蒸留バージョンを提供します。
  • OpenCLIP統合: 厳密な科学的アブレーション研究を促進するために、元のOpenAI CLIPの設定に密接に準拠しています。
  • 多言語対応: facebook/xlm-v-baseなどのトークナイザーを使用して、世界中のテキスト入力を処理します。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • Dispatch
  • Dispatch