facebookresearch/MetaCLIP

NeurIPS 2025 Spotlight; ICLR2024 Spotlight; CVPR 2024; EMNLP 2024

解決的問題

Meta CLIP 解決了以英語為中心的對比語言-影像預訓練(CLIP)模型的限制。具體而言,它應對了大規模非英語資料整理流程的缺失以及「多語言的詛咒」問題,即在加入多種語言時,性能往往劣於純英語模型的英語表現。

工作原理

Meta CLIP 提供了一套全面的 CLIP 全球擴展方案。這包括專門的資料整理、建模和訓練策略,使英語與非英語資料能夠相互促進,共同提升性能,從而實現最先進的多語言性能。

適用對象

專為需要理解多種全球語言中影像與文字的研究人員和開發者設計,適用於建構多模態 AI 系統。

主要亮點

  • 全球擴展:將 CLIP 擴展至全球資料,克服了英語與多語言能力之間的性能權衡。
  • 豐富的模型庫:提供多種預訓練模型,包括 Meta CLIP 1 和 Meta CLIP 2,涵蓋多種 ViT 架構(S, M, B, L, H, bigG)和解析度。
  • 蒸餾模型:提供 Meta CLIP 2 的蒸餾版本,便於更高效的部署。
  • OpenCLIP 集成:緊密遵循原始 OpenAI CLIP 的設定,便於進行嚴謹的科學消融研究。
  • 多語言支援:使用 facebook/xlm-v-base 等分詞器處理全球文字輸入。

相關

  • 專案
  • 專案
  • Dispatch
  • Dispatch
  • Dispatch