OFA-Sys/Chinese-CLIP

Chinese version of CLIP which achieves Chinese cross-modal retrieval and representation generation.

What it solves

Chinese-CLIP 提供了一个中文版的 CLIP (Contrastive Language-Image Pre-training) 模型。它解决了缺乏专门针对中文优化的、高性能、大规模视觉-语言模型的问题,从而实现跨模态检索、零样本图像分类以及图像-文本相似度计算等任务。

How it works

Chinese-CLIP 基于 open_clip 项目构建,是在约 2 亿对中文图像-文本对的大规模数据集上进行训练的。它使用双编码器架构(一个用于视觉,一个用于文本)将两种模态映射到共享的嵌入空间中。该项目提供各种模型规模(从 RN50 到 ViT-H-14),并支持 FlashAttention、梯度积累和 FLIP 训练策略等先进的训练优化技术,以提高效率和性能。

Who it’s for

该项目是为从事中文多模态 AI 研究与开发的开发者和研究人员设计的,特别是在中文环境下需要实现图像-文本搜索、图像自动标签化或零样本分类的人员。

Highlights

  • Large Scale Training: 在约 2 亿对中文图像-文本对上进行训练。
  • Multiple Model Sizes: 最提供五种不同的规模,包括 ResNet50 和各种 Vision Transformer (ViT) 配置。
  • Deployment Ready: 包含对 ONNX、TensorRT 和 CoreML 的支持,以实现更快的推理和部署。
  • Flexible Training: 支持知识蒸馏微调、分布式训练和梯度检查点以提高内存效率。"},