비전‑언어 모델 탐구
비전-언어 모델(VLM)은 이미지와 자연어 텍스트를 모두 처리하도록 시각 및 언어 모달리티를 통합하여 제로샷 이미지 분류, 이미지 캡션 생성, 시각 질문 응답과 같은 복잡한 작업을 가능하게 합니다. 시각과 언어에 대한 별도 또는 융합 인코더를 활용함으로써, 이러한 모델은 시각 정보를 텍스트 설명과 연결하여 모달리티 간 추론 및 검색을 수행할 수 있습니다.
비전-언어 사전 학습을 위한 핵심 학습 전략
현대 비전-언어 모델은 일반적으로 이미지 인코더, 텍스트 인코더, 그리고 융합 전략을 사용합니다. 초기 모델이 수작업으로 만든 디스크립터에 의존했던 반면, 현재 연구는 주로 Transformer 아키텍처를 활용합니다. 다음 다섯 가지 전략이 이러한 모델을 사전 학습하는 주요 접근 방식을 정의합니다:
1. 대조 학습
대조 학습은 일치하는 이미지‑텍스트 쌍 사이의 거리를 최소화하고, 일치하지 않는 쌍 사이의 거리를 최대화함으로써 이미지와 텍스트를 공동 특징 공간에 정렬합니다.
- Key Models: CLIP, CLOOB, ALIGN, and DeCLIP.
- Mechanism: 이 모델들은 대규모 {image, caption} 쌍 데이터셋을 사용합니다. 예를 들어, CLIP은 코사인 거리를 이용해 임베딩 유사성을 측정합니다.
- Variations: LiT (Language-Image Pre-training)는 이미지 인코더를 고정한 채 텍스트 인코더만 미세 조정하여 샘플 효율성을 높입니다.
2. PrefixLM
PrefixLM은 이미지를 언어 모델의 프리픽스로 취급하여, 시각 입력을 기반으로 시퀀스의 다음 토큰을 예측하도록 합니다.
- Mechanism: Visual Transformers(ViT)는 이미지를 패치로 나누어 순차적으로 입력합니다. SimVLM 및 VirTex와 같은 모델에서는 인코더가 이미지 패치와 프리픽스 텍스트를 결합해 입력하고, 디코더가 텍스트의 연속을 예측합니다.
- Frozen PrefixLM: 효율성을 높이기 위해 Frozen 및 ClipCap과 같은 모델은 언어 모델을 고정하고 이미지 인코더만 업데이트하여 이미지 임베딩을 고정된 LM 공간에 맞춥니다.
- Advanced Architectures: Flamingo는 Perceiver Resampler 모듈과 새로운 교차‑어텐션 레이어를 사용해 고정된 LM을 시각 데이터에 조건화하고, 최첨단 few‑shot 학습을 달성합니다.
3. 교차 주의가 포함된 다중 모달 융합
이 전략은 이미지를 프리픽스로 사용하지 않고, 교차‑어텐션 메커니즘을 통해 시각 정보를 언어 모델 디코더의 레이어에 직접 융합합니다.
- Key Models: VisualGPT, VC‑GPT, and Flamingo.
- Goal: 대규모 다중 모달 데이터셋이 부족할 때 텍스트 생성 능력과 시각 정보를 균형 있게 유지하는 것이 핵심입니다. FIBER는 교차‑어텐션 레이어와 게이팅 메커니즘을 시각 및 언어 백본 모두에 삽입해 이를 개선합니다.
4. 마스크 언어 모델링(MLM) 및 이미지‑텍스트 매칭(ITM)
MLM과 ITM은 특정 이미지 영역을 해당 텍스트 조각과 정렬합니다.
- MLM: 모델은 연관된 이미지를 기반으로 캡션의 마스크된 단어를 예측합니다. 이는 종종 바운딩 박스나 객체 탐지 모델(예: Faster‑RCNN)을 사용해 영역 제안을 생성해야 합니다.
- ITM: 모델은 주어진 이미지와 캡션 쌍이 실제로 일치하는지 여부를 예측합니다.
- Key Models: VisualBERT, FLAVA, ViLBERT, LXMERT, and BridgeTower. FLAVA는 특히 MLM, ITM, Masked‑Image Modeling(MIM), 그리고 대조 학습을 결합합니다.
5. 훈련 없음(최적화 기반)
일부 전략은 사전 학습된 단일 모달 모델을 활용해 추가 학습 없이 모달리티를 연결합니다.
- MaGiC: 자동 회귀 LM을 사용해 캡션을 생성하고, CLIP 기반 "Magic score"로 최적화합니다.
- ASIF: 소규모 실제 다중 모달 쌍 데이터셋으로 만든 상대 표현 공간에서 유사도 기반 검색을 수행합니다.
다중 모달 데이터셋
사전 학습 데이터셋
VLM은 대규모 웹 스크래핑 이미지‑텍스트 쌍 데이터셋으로 사전 학습됩니다. 예시:
- PMD: Flickr30K, COCO, 그리고 Conceptual Captions의 조합.
- LAION‑5B: CLIP을 사용해 노이즈를 필터링하고 고품질 쌍을 보장하는 대규모 데이터셋.
- COCO: 객체 라벨과 자연어 문장 설명이 포함된 이미지 인스턴스.
- Conceptual Captions & Flickr30K: 웹에서 스크래핑한 이미지와 자유 형식 캡션으로 구성.
다운스트림 데이터셋
특정 작업을 위해 파인튜닝이 이루어지는 데이터셋:
- Visual Question Answering (VQA): VQA, VQA v2, NLVR2, OKVQA, TextVQA, TextCaps, and VizWiz.
- Classification & Reasoning: Hateful Memes(다중 모달 분류), SNLI‑VE(시각적 함의), and Winoground(구성적 추론).
🤗 Transformers에서 구현
Hugging Face Transformers는 다양한 VLM을 지원하며, 제로샷 분류, 세그멘테이션, VQA 등을 위한 도구를 제공합니다.
지원 모델
- General Purpose: CLIP, FLAVA, BridgeTower, BLIP, LiT.
- Specialized Tasks: OWL‑ViT(제로샷 객체 탐지), CLIPSeg 및 GroupViT(이미지 세그멘테이션), and X‑CLIP(제로샷 비디오 분류).
- Architecture Templates:
VisionEncoderDecoderModel은 사용자가 任意의 Transformer 기반 시각 인코더(예: ViT, Swin)와 任意의 언어 디코더(예: GPT2, BERT)를 결합할 수 있게 합니다.
실용 예시
- ViLT for VQA: 사용자는
ViltForQuestionAnswering와ViltProcessor를 이용해 이미지와 질문(예: "고양이가 몇 마리 있나요?")을 입력하고 예측 답변을 받을 수 있습니다. - CLIPSeg for Segmentation:
CLIPSegForImageSegmentation은 텍스트 설명(예: "고양이")을 제공해 이미지 내 특정 객체에 대한 이진 세그멘테이션 맵을 생성함으로써 제로샷 세그멘테이션을 가능하게 합니다.
떠오르는 연구 분야
비전‑언어 표현은 전문 분야와 복합 물리적 상호작용으로 확장되고 있습니다:
- Medicine: Clinical‑BERT는 의료 진단 및 보고서 생성에 사용되며, MedFuseNet은 의료 VQA를 처리합니다.
- Image & 3D Manipulation: StyleCLIP 및 DiffusionCLIP은 이미지 조작을, AvatarCLIP 및 Text2Mesh는 3D 형태와 텍스처 조작을 지원합니다.
- Robotics: CLIPort는 모방 학습을 위한 공동 표현을 사용합니다. 대형 언어 모델(LLM)은 ProgPrompt와 SayCan처럼 로봇 작업 계획 및 추론에 통합되고 있습니다. OWL‑ViT와 GLIP 같은 오픈‑보카뷸러리 탐지 모델의 등장으로 다중 모달 모델이 로봇 내비게이션 및 조작에 더욱 깊게 통합될 것으로 기대됩니다.