facebookresearch/MetaCLIP
NeurIPS 2025 Spotlight; ICLR2024 Spotlight; CVPR 2024; EMNLP 2024
해결하는 문제
Meta CLIP은 영어 중심의 대조적 언어-이미지 사전 학습(CLIP) 모델의 한계를 해결합니다. 특히 대규모 비영어 데이터 컬렉션 파이프라인의 부족과 "다언어의 저주"라는 문제를 다룹니다. 즉, 여러 언어를 추가할수록 영어 전용 모델에 비해 영어 성능이 저하되는 현상입니다.
작동 방식
Meta CLIP은 CLIP을 전 세계 데이터에 스케일링하기 위한 포괄적인 레시피를 제공합니다. 이는 영어와 비영어 데이터가 서로 보완하고 성능을 향상시킬 수 있도록 하는 특화된 데이터 컬렉션, 모델링 및 훈련 전략을 포함합니다. 이를 통해 최고 수준의 다언어 성능을 달성합니다.
대상 사용자
다양한 글로벌 언어에서 이미지와 텍스트를 이해해야 하는 멀티모달 AI를 개발하는 연구자 및 개발자에게 적합합니다.
주요 특징
- 세계 규모 스케일링: 영어와 다언어 기능 간의 성능 트레이드오프를 극복하고, 전 세계 데이터에 CLIP을 확장합니다.
- 풍부한 모델 풀: 다양한 ViT 아키텍처(S, M, B, L, H, bigG)와 해상도를 갖춘 Meta CLIP 1 및 Meta CLIP 2를 포함한 다양한 사전 학습 모델을 제공합니다.
- 증류 모델: 더 효율적인 배포를 위한 Meta CLIP 2의 증류 버전을 제공합니다.
- OpenCLIP 통합: 엄격한 과학적 아블레이션 연구를 가능하게 하기 위해 원본 OpenAI CLIP 설정에 밀접하게 부합합니다.
- 다언어 지원:
facebook/xlm-v-base와 같은 토크나이저를 사용하여 전 세계 텍스트 입력을 처리합니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- Dispatch
- Dispatch