Stanford CS336 Lecture 17: Multimodal Language Modeling

Multimodal Modeling 개요

Multimodal 모델은 텍스트-to-텍스트 능력을 넘어 텍스트, 이미지, 오디오, 비디오를 포함한 모든 모달리티의 조합을 입력받고 출력할 수 있는 "omni models"를 지향합니다. Transformer는 이러한 모달리티 전반에 걸쳐 규모 면에서 가장 효과적인 아키텍처이기 때문에, 주요 기술적 과제는 비텍스트 데이터를 Transformer가 처리할 수 있는 이산적(discrete) 또는 연속적(continuous) 토큰으로 변환하는 것입니다.

기초: CLIP 및 SigLIP

현대적인 Vision-Language Models (VLMs)는 이미지를 텍스트와 호환되는 의미 공간(semantic space)으로 매핑하는 인코더에 크게 의존합니다.

CLIP (Contrastive Language Image Pre-Training)

CLIP은 웹에서 수집된 방대한 양의 노이즈 섞인 이미지-텍스트 쌍을 활용하도록 설계되었습니다. CLIP은 대조 학습(contrastive objective)을 사용합니다. 이미지-텍스트 쌍의 배치가 주어지면, 모델은 올바른 이미지-텍스트 쌍 사이의 내적(dot product)은 최대화하고 배치 내 다른 모든 쌍에 대해서는 이를 최소화합니다.

  • Architecture: CLIP은 일반적으로 Vision Transformer (ViT)를 이미지 인코더로 사용하여 이미지를 패치(예: 14x14)로 나누고 이를 토큰으로 처리합니다. 텍스트 인코더는 GPT-2 스타일의 transformer입니다.
  • Key Result: CLIP은 유기적인 웹 데이터를 활용함으로써 ImageNet과 같은 정제된 데이터셋으로 학습된 모델보다 제로샷(zero-shot) 이미지 분류 성능이 뛰어날 수 있음을 입증했습니다.
  • Limitation: CLIP은 softmax 연산이 전체 배치에 대해 수행되기 때문에 매우 큰 배치 크기(예: 32,000)가 필요하며, 이로 인해 병렬화 및 분해가 어렵습니다.

SigLIP (Sigmoid Loss for Language Image Pre-Training)

SigLIP은 다중 클래스 softmax 손실을 더 단순한 sigmoid 손실로 대체하여 CLIP을 개선했습니다. 하나의 이미지를 배치 내의 텍스트들과 비교하여 순위를 매기는 대신, SigLIP은 각 이미지-텍스트 쌍을 이진 분류 문제(정렬됨 또는 그렇지 않음)로 취급합니다.

  • Efficiency: 이러한 변화는 손실 함수를 배치 크기와 분리하여, 더 효율적인 학습과 더 작은 배치 크기에서도 더 나은 성능을 가능하게 합니다.
  • Parallelization: SigLIP은 단일 장치에 전체 배치가 필요하지 않도록 pod 전체에 텍스트 임베딩을 회전(rotate)시켜 음성(negatives)을 계산함으로써 장치 간 더 나은 분산을 가능하게 합니다.

Vision-Language Model (VLM) 아키텍처

대부분의 오픈 소스 VLM은 다음과 같은 템플릿을 따릅니다: 사전 학습된 비전 인코더, 디코더로서의 대규모 언어 모델 (LLM), 그리고 비전 임베딩을 LLM의 토큰 공간으로 매핑하는 "projector" 또는 adapter.

LLaVA (Large Language-and-Vision Assistant)

LLaVA는 CLIP 인코더와 Vicuna (Llama 기반) LLM을 결합하는 방법을 보여줍니다.

  • Data Synthesis: LLaVA는 GPT-4를 사용하여 MS COCO의 인간 주석 캡션을 기반으로 합성 대화, 상세 설명 및 복잡한 추론을 생성했습니다.
  • Training Stages:
    1. Alignment Phase: 비전 인코더와 LLM은 동결(frozen)되며, 이미지 벡터를 텍스트 임베딩 공간으로 매핑하기 위해 projector (선형 행렬 $W$)만 학습됩니다.
    2. Fine-tuning Phase: 비전 인코더는 동결된 상태를 유지하지만, projector와 LLM은 합성된 멀티모달 데이터로 함께 학습됩니다.

LLaVA OneVision 및 AnyRes

고해상도 이미지와 OCR을 처리하기 위해 LLaVA OneVision은 AnyRes를 도입했습니다. 이미지를 고정된 정사각형(예: 336x336)으로 다운샘플링하는 대신, AnyRes는 이미지를 인코더의 네이티브 해상도를 가진 여러 크롭(crop)으로 나누고 결과 벡터를 연결합니다. 이를 통해 모델은 다양한 이미지 종횡비에 적응하면서도 세밀한 디테일을 보존할 수 있습니다.

Qwen-VL 시리즈

Qwen-VL과 그 후속 모델들(Qwen-2, Qwen-3)은 VLM 파이프라인을 더욱 정교화했습니다:

  • Dynamic Resolution: Qwen-2는 이미지 크기에 따라 가변적인 수의 토큰으로 매핑되는 시스템을 구현하여, 컨텍스트 길이를 관리하기 위해 패치를 압축합니다.
  • Multimodal RoPE (M-RoPE): 3D 시공간 데이터(높이, 너비, 시간)를 처리하기 위해 Qwen은 다차원 회전 위치 임베딩(Rotary Positional Embedding)을 사용합니다. Qwen-3는 모든 축이 저주파와 고주파 모두에 노출되도록 차원을 인터리빙(interleaving)하여 이를 개선했습니다.
  • Explicit Timestamps: Qwen-3는 모델이 비디오의 특정 순간을 참조할 수 있도록 명시적인 시간 토큰(예: "0 seconds")을 도입했습니다.
  • Deep Fusion: 단순한 projector를 사용하는 대신, 후기 버전은 비전 임베딩을 LLM의 residual stream에 직접 통합하는 더 정교한 adapter (DeepStack)를 사용했습니다.

Native Multimodality: Chameleon 방식

대부분의 VLM이 텍스트만 출력하는 "stitched" 모델인 반면, Meta의 Chameleon은 모든 것을 토큰으로 이산화하여 네이티브 멀티모달리티를 시도합니다.

  • VQ-VAE (Vector Quantized Variational Autoencoder): 이미지는 이산적인 코드북(예: 8,000개의 프로토타입 벡터)에 매핑됩니다. 이미지는 텍스트와 마찬가지로 이산적 토큰의 시퀀스가 됩니다.
  • Unified Training: 이미지가 이제 토큰이 되었기 때문에, 단일 transformer는 텍스트인지 이미지인지에 관계없이 다음 토큰을 예측하도록 학습될 수 있습니다. 이를 통해 이미지와 텍스트가 교차된(interleaved) 생성이 가능해집니다.
  • Challenges: 이 방식은 텍스트 토큰에 비해 이미지 토큰의 높은 엔트로피로 인해 학습 불안정성 문제를 겪습니다. 또한 이산화로 인해 세밀한 정보(OCR의 작은 텍스트와 같은)를 잃을 수 있습니다.

기술적 트레이드오프 요약

특징 Stitched VLMs (LLaVA/Qwen) Native Multimodal (Chameleon)
입력 연속적 임베딩 $\rightarrow$ Projector $\rightarrow$ LLM 이산적 토큰 $\rightarrow$ LLM
출력 텍스트 전용 교차된 텍스트 및 이미지
출력 방식 LLM 토큰 예측 LLM 토큰 예측
정보 손실 낮음 (연속적 인코더) 높음 (이산화)
학습 안정성 높음 낮음 (엔트로피 불일치)

Sources