OFA-Sys/Chinese-CLIP
Chinese version of CLIP which achieves Chinese cross-modal retrieval and representation generation.
What it solves
Chinese-CLIP은 중국어 버전의 CLIP (Contrastive Language-Image Pre-training) 모델을 제공합니다. It addresses the lack of highly-performing, large-scale vision-language models specifically optimized for the Chinese language, enabling tasks like cross-modal retrieval, zero-shot image classification, and image-text similarity calculations.
How it works
open_clip 프로젝트를 기반으로 구축된 Chinese-CLIP은 약 2억 개의 중국어 이미지-텍스트 쌍의 대규모 데이터셋으로 학습되었습니다. 이 모델은 이중 인코더 아키텍처(시각용 하나, 텍스트용 하나)를 사용하여 두 모달리티를 공유된 임베딩 공간으로 매핑합니다. 이 프로젝트는 다양한 모델 규모(RN50부터 ViT-H-14까지)를 제공하며, FlashAttention, 그래디언트 누적, 그리고 FLIP 학습 전략과 같은 고급 학습 최적화를 지원하여 효율성과 성능을을 향상시킵니다.
Who it’s for
이 프로젝트는 중국어 멀티모달 AI를 다루는 개발자와 연구자, 특히 중국어 이미지-텍스트 검색, 자동 이미지 태깅, 또는 제로샷 분류를 구현해야 하는 분들을 위해 설계되었습니다.
Highlights
- Large Scale Training: 약 2억 개의 중국어 이미지-텍스트 쌍으로 학습되었습니다.
- Multiple Model Sizes: ResNet50 및 다양한 Vision Transformer (ViT) 구성을 포함하여 5가지 다른 규모를를 제공합니다.
- Deployment Ready: 더 빠른 추론 및 배포를 위해 ONNX, TensorRT, 및 CoreML 지원을 포함합니다.
- Flexible Training: 할당된 메모리 효율성을 위해 지식 증류 미세 조정, 분산 학습, 그리고 그래디언트 체크포인팅을 지원합니다.