facebookresearch/MetaCLIP

NeurIPS 2025 Spotlight; ICLR2024 Spotlight; CVPR 2024; EMNLP 2024

解决的问题

Meta CLIP 解决了以英语为中心的对比语言-图像预训练(CLIP)模型的局限性。具体而言,它应对了大规模非英语数据整理流程的缺失以及"多语言诅咒"问题,即在添加多种语言时,性能往往会劣于纯英语模型的英语表现。

工作原理

Meta CLIP 提供了一套全面的 CLIP 全球化扩展方案。这包括专门的数据整理、建模和训练策略,使英语和非英语数据能够相互促进,共同提升性能,从而实现最先进的多语言性能。

适用人群

专为需要理解多种全球语言中图像与文本的研究人员和开发者设计,适用于构建多模态 AI 系统。

主要亮点

  • 全球扩展:将 CLIP 扩展至全球数据,克服了英语与多语言能力之间的性能权衡。
  • 丰富的模型库:提供多种预训练模型,包括 Meta CLIP 1 和 Meta CLIP 2,涵盖多种 ViT 架构(S, M, B, L, H, bigG)和分辨率。
  • 蒸馏模型:提供 Meta CLIP 2 的蒸馏版本,便于更高效的部署。
  • OpenCLIP 集成:紧密遵循原始 OpenAI CLIP 的设置,便于进行严谨的科学消融研究。
  • 多语言支持:使用 facebook/xlm-v-base 等分词器处理全球文本输入。

相关

  • 项目
  • 项目
  • Dispatch
  • Dispatch
  • Dispatch