IDEFICS: 최첨단 시각 언어 모델의 오픈 재현
Hugging Face는 IDEFICS(Image-aware Decoder Enhanced à la Flamingo with Interleaved Cross-attentionS)를 출시했는데, 이는 오픈 액세스 시각 언어 모델입니다. IDEFICS는 DeepMind의 Flamingo의 오픈 재현으로, 독점적인 멀티모달 모델에 대한 투명하고 오픈된 대안을 AI 커뮤니티에 제공하기 위해 설계되었습니다.
모델 기능 및 변형
IDEFICS는 임의의 인터리브된 이미지와 텍스트 시퀀스를 입력으로 받아 일관된 텍스트를 출력으로 생성할 수 있는 멀티모달 모델입니다. 이를 통해 모델은 이미지에 대한 질문 답변, 시각적 콘텐츠 설명, 여러 이미지를 기반으로 한 스토리 생성과 같은 작업을 수행할 수 있습니다.
이 모델은 두 가지 주요 크기와 두 가지 기능적 변형으로 제공됩니다:
- 파라미터 크기: 90억 및 800억 파라미터.
- 모델 변형: 대화형 사용 사례에 특별히 적응된 기본 버전과 지시 버전(예:
idefics-80B-instruct및idefics-9B-instruct).
기술 아키텍처 및 기초
IDEFICS는 공개적으로 이용 가능한 모델과 데이터를 사용하여 구축되었습니다. 다음과 같은 구성 요소를 활용합니다:
- 언어 모델: LLaMA v1.
- 시각 인코더: OpenCLIP.
이 두 개의 사전 훈련된 모델은 Hugging Face가 훈련시킨 새로 초기화된 매개변수를 통해 연결됩니다. 기본 모델은 동결되어 있지만, 이러한 연결 매개변수는 MIT 라이선스 하에 공개됩니다.
훈련 데이터 및 OBELICS 데이터셋
IDEFICS는 Wikipedia, Public Multimodal Dataset, LAION 등을 포함한 오픈 데이터셋의 혼합물로 훈련되었습니다. 능력을 향상시키기 위해 Hugging Face는 웹에서 스크랩된 1억 4100만 개의 인터리브된 이미지-텍스트 문서로 구성된 새로운 데이터셋인 OBELICS를 생성하고 공개했는데, 이는 총 3억 5300만 개의 이미지와 1150억 개의 토큰을 포함합니다.
윤리적 평가 및 투명성
투명성과 안전성을 보장하기 위해 Hugging Face는 자기 비판적, 투명하고 공정성에 초점을 맞춘 윤리 헌장을 따랐습니다. 출시 과정에는 다음이 포함되었습니다:
- 레드 팀링: 이미지와 텍스트를 이용한 적대적 프롬프트를 사용한 내부 평가를 통해 잠재적인 편향을 식별하고 완화합니다.
- 문서화: 커뮤니티에 학습 자료를 제공하기 위해 구축 과정에서 발견된 기술적 교훈과 실수를 공개합니다.
- 툴링: Nomic AI를 통해 OBELICS 데이터셋에 대한 인터랙티브 시각화를 제공합니다.
라이선스 및 접근
IDEFICS에 대한 접근은 기본 구성 요소의 라이선스에 따릅니다:
- CLIP-ViT-H-14-laion2B-s32B-b79K: MIT 라이선스 하에 출시되었습니다.
- llama-65b: 비상업적 연구 라이선스 하에 출시되었습니다.(Meta 신청서 필요)
- 추가 가중치: 새로 훈련된 연결 매개변수는 MIT 라이선스 하에 출시되었습니다.
IDEFICS는 transformers 라이브러리에 통합되어 있으며, 사용자는 IdeficsForVisionText2Text 및 AutoProcessor를 통해 모델을 로드할 수 있습니다.