OFA-Sys/Chinese-CLIP

Chinese version of CLIP which achieves Chinese cross-modal retrieval and representation generation.

What it solves

Chinese-CLIPは、中国語版のCLIP (Contrastive Language-Image Pre-training) モデルを提供します。これにより、中国語に特化して最適化された高性能で大規模な視覚-言語モデルの不足を解消し、クロスモーダル検索、ゼロショット画像分類、画像-テキスト類似度計算などのタスクを実現します。

How it works

open_clip プロジェクトに基づき、Chinese-CLIPは約2億組の中国語画像-テキストペアの大規模データセットで学習されました。二重エンコーダーアーキテクチャ(視覚用とテキスト用)を使用して、両方のモ態を共有の埋め込み空間にマッピングします。このプロジェクトは、さまざまなモデルスケール(RN50からViT-H-14まで)を提供し、FlashAttention、勾配累積、FLIP学習戦略などの高度な学習最適化技術をサポートしています。効率と性能を向上させます。

Who it’s for

このプロジェクトは、中国語のマルチモーダルAIに取り組む開発者や研究者、特に中国語での画像-テキスト検索、自動画像タグ付け、またはゼロショット分類を実装する必要がある方向けに設計されています。

Who it’s for

このプロジェクトは、中国語のマルチモーダルAIに取り組む手掛ける開発者や研究者、特に中国語での画像-テキスト検索、自動画像タグ付け、またはゼロショット分類を実装する必要がある方向けに設計されています。

Highlights

  • Large Scale Training: 約2億組の中国語画像-テキストペアで学習。
  • Multiple Model Sizes: ResNet50や様々なVision Transformer (ViT)構成を含む、5つの異なるスケールを提供。
  • Deployment Ready: 高速な推論とデプロイのために、ONNX、TensorRT、およびCoreMLのサポートを含みます。
  • Flexible Training: 知識蒸留微調整、分散トレーニング、およびメモリ効率向上のための勾配チェックポイントをサポート。