facebookresearch/MetaCLIP
NeurIPS 2025 Spotlight; ICLR2024 Spotlight; CVPR 2024; EMNLP 2024
解决的问题
Meta CLIP 解决了以英语为中心的对比语言-图像预训练(CLIP)模型的局限性。具体而言,它应对了大规模非英语数据整理流程的缺失以及"多语言诅咒"问题,即在添加多种语言时,性能往往会劣于纯英语模型的英语表现。
工作原理
Meta CLIP 提供了一套全面的 CLIP 全球化扩展方案。这包括专门的数据整理、建模和训练策略,使英语和非英语数据能够相互促进,共同提升性能,从而实现最先进的多语言性能。
适用人群
专为需要理解多种全球语言中图像与文本的研究人员和开发者设计,适用于构建多模态 AI 系统。
主要亮点
- 全球扩展:将 CLIP 扩展至全球数据,克服了英语与多语言能力之间的性能权衡。
- 丰富的模型库:提供多种预训练模型,包括 Meta CLIP 1 和 Meta CLIP 2,涵盖多种 ViT 架构(S, M, B, L, H, bigG)和分辨率。
- 蒸馏模型:提供 Meta CLIP 2 的蒸馏版本,便于更高效的部署。
- OpenCLIP 集成:紧密遵循原始 OpenAI CLIP 的设置,便于进行严谨的科学消融研究。
- 多语言支持:使用
facebook/xlm-v-base等分词器处理全球文本输入。
相关
- 项目
- 项目
- Dispatch
- Dispatch
- Dispatch