OFA-Sys/Chinese-CLIP

Chinese version of CLIP which achieves Chinese cross-modal retrieval and representation generation.

What it solves

Chinese-CLIP 提供了一個中文版的 CLIP (Contrastive Language-Image Pre-training) 模型。它解決了缺乏專門針對中文優化的、高性能、大規模視覺-語言模型的問題,從而實現了跨模態檢索、零樣本圖像分類以及圖像-文本相似度計算等任務。

How it works

Chinese-CLIP 基於 open_clip 專案建立,是在約 2 億對中文圖像-文本對的大規模數據集上進行訓練的。它使用雙編碼器架構(一個用於視覺,一個用於文本)將兩種模態映射到共享的嵌入空間中。該專案提供各種模型規模(從 RN50 到 ViT-H-14),並支持 FlashAttention、梯度累積和 FLIP 訓練策略等先進的訓練優化技術,以提高效率和性能。

Who it’s for

此專案是為從事中文多模態 AI 研究與開發的開發者和研究人員設計的,特別是那些需要在中文環境下實現圖像-文本搜索、自動圖像標籤化或零樣本分類的人員。

Highlights

  • Large Scale Training: 使用約 2 億對中文圖像-文本對進行訓練。
  • Multiple Model Sizes: 提供五種不同的規模,包括 ResNet50 和各種 Vision Transformer (ViT) 配置。
  • Deployment Ready: 包含對 ONNX、TensorRT 和 CoreML 的支持,以實現更快的推理和部署。
  • Flexible Training: 支持知識蒸餾微調、分佈式訓練和梯度檢查點以提高內存效率。"},