facebookresearch/MetaCLIP
NeurIPS 2025 Spotlight; ICLR2024 Spotlight; CVPR 2024; EMNLP 2024
解決的問題
Meta CLIP 解決了以英語為中心的對比語言-影像預訓練(CLIP)模型的限制。具體而言,它應對了大規模非英語資料整理流程的缺失以及「多語言的詛咒」問題,即在加入多種語言時,性能往往劣於純英語模型的英語表現。
工作原理
Meta CLIP 提供了一套全面的 CLIP 全球擴展方案。這包括專門的資料整理、建模和訓練策略,使英語與非英語資料能夠相互促進,共同提升性能,從而實現最先進的多語言性能。
適用對象
專為需要理解多種全球語言中影像與文字的研究人員和開發者設計,適用於建構多模態 AI 系統。
主要亮點
- 全球擴展:將 CLIP 擴展至全球資料,克服了英語與多語言能力之間的性能權衡。
- 豐富的模型庫:提供多種預訓練模型,包括 Meta CLIP 1 和 Meta CLIP 2,涵蓋多種 ViT 架構(S, M, B, L, H, bigG)和解析度。
- 蒸餾模型:提供 Meta CLIP 2 的蒸餾版本,便於更高效的部署。
- OpenCLIP 集成:緊密遵循原始 OpenAI CLIP 的設定,便於進行嚴謹的科學消融研究。
- 多語言支援:使用
facebook/xlm-v-base等分詞器處理全球文字輸入。
相關
- 專案
- 專案
- Dispatch
- Dispatch
- Dispatch