mlfoundations/open_clip

An open source implementation of CLIP.

解決的問題

OpenCLIP 是 OpenAI CLIP(Contrastive Language-Image Pre-training)的開源實作,提供了一個框架來訓練和使用能夠理解圖像與文字之間關係的大規模模型。它讓研究人員和開發者能夠存取在各種大型資料集(如 LAION 和 DataComp)上訓練的各種預訓練模型,從而無需從頭訓練這些耗費大量資源的模型。

運作方式

該專案實作了對比學習方法,其中圖像編碼器和文字編碼器經過訓練,將圖像及其對應的標題映射到一個共享的嵌入空間。這使得系統能夠確定特定圖像與特定文字之間的匹配程度。該函式庫支援多種架構,包括 Vision Transformers (ViT) 和 ConvNext,並與 timm(用於圖像編碼器)和 Hugging Face(用於分詞器)等工具整合。

適用對象

它專為 AI 研究人員、機器學習工程師以及構建需要零樣本圖像分類、圖文檢索或多模態理解應用程式的開發者所設計。

亮點

  • 豐富的預訓練模型庫:存取在 LAION-2B 和 DataComp-1B 等資料集上訓練的眾多模型,這些模型在 ImageNet 上具有極高的零樣本準確度。
  • 多樣的模型家族:支援 CLIP、SigLIP、CoCa、MaMMUT 以及如 NaFlex(可變解析度圖像和音訊)等較新的實驗性架構。
  • 進階訓練技術堆疊:包含對 FSDP2、torch.compile 策略和長度分桶的支援,以最佳化訓練效率。
  • 多模態擴展:除了圖像,它還支援音訊-文字對比訓練 (CLAP) 和生成式字幕生成 (GenLIP/GenLAP)。

相關

  • Dispatch
  • 專案
  • 專案
  • Dispatch
  • Dispatch