OFA-Sys/Chinese-CLIP

Chinese version of CLIP which achieves Chinese cross-modal retrieval and representation generation.

What it solves

Chinese-CLIP은 중국어 버전의 CLIP (Contrastive Language-Image Pre-training) 모델을 제공합니다. It addresses the lack of highly-performing, large-scale vision-language models specifically optimized for the Chinese language, enabling tasks like cross-modal retrieval, zero-shot image classification, and image-text similarity calculations.

How it works

open_clip 프로젝트를 기반으로 구축된 Chinese-CLIP은 약 2억 개의 중국어 이미지-텍스트 쌍의 대규모 데이터셋으로 학습되었습니다. 이 모델은 이중 인코더 아키텍처(시각용 하나, 텍스트용 하나)를 사용하여 두 모달리티를 공유된 임베딩 공간으로 매핑합니다. 이 프로젝트는 다양한 모델 규모(RN50부터 ViT-H-14까지)를 제공하며, FlashAttention, 그래디언트 누적, 그리고 FLIP 학습 전략과 같은 고급 학습 최적화를 지원하여 효율성과 성능을을 향상시킵니다.

Who it’s for

이 프로젝트는 중국어 멀티모달 AI를 다루는 개발자와 연구자, 특히 중국어 이미지-텍스트 검색, 자동 이미지 태깅, 또는 제로샷 분류를 구현해야 하는 분들을 위해 설계되었습니다.

Highlights

  • Large Scale Training: 약 2억 개의 중국어 이미지-텍스트 쌍으로 학습되었습니다.
  • Multiple Model Sizes: ResNet50 및 다양한 Vision Transformer (ViT) 구성을 포함하여 5가지 다른 규모를를 제공합니다.
  • Deployment Ready: 더 빠른 추론 및 배포를 위해 ONNX, TensorRT, 및 CoreML 지원을 포함합니다.
  • Flexible Training: 할당된 메모리 효율성을 위해 지식 증류 미세 조정, 분산 학습, 그리고 그래디언트 체크포인팅을 지원합니다.