Idefics2 8B 비전-언어 모델 출시 – 아키텍처, 데이터, 및 성능

TL;DR

Idefics2는 Hugging Face에서 출시한 80억 파라미터 오픈소스 비전-언어 모델로, 시각 질문 응답 및 OCR 작업에서 최첨단 성능을 제공하며 🤗 Transformers와 완전히 호환되어 손쉬운 파인튜닝이 가능합니다.


Idefics2 개요

Idefics2는 텍스트와 이미지를 임의의 순서로 받아 텍스트 응답을 생성하는 범용 멀티모달 모델입니다. 이미지에 대한 질문에 답하고, 시각적 내용을 설명하며, 다중 이미지 스토리를 만들고, 문서에서 정보를 추출하고, 기본적인 산술 연산을 수행할 수 있습니다. 이 모델은 Apache 2.0 라이선스로 출시되어 자유롭게 사용 및 재배포할 수 있습니다.

기술 하이라이트

모델 크기 및 아키텍처

  • Parameters: 8 B, Idefics1(80 B) 대비 10배 감소했지만 우수한 성능을 제공합니다.
  • Backbones: Mistral‑7B‑v0.1(언어)과 SigLIP‑SO400M‑Patch14‑384(비전) 위에 구축되었으며, 두 모델 모두 Apache‑2.0 라이선스를 가집니다.
  • Vision Integration: 이미지는 NaViT 전략을 사용해 최대 980 × 980의 원시 해상도로 처리되어 고정 크기 리사이징을 피합니다. 매우 고해상도 입력에 대해서는 선택적인 서브 이미지 분할(4방향)이 SPHINX/LLaVA‑NeXT 방식을 따릅니다.
  • Feature Fusion: 시각 특징은 인코딩된 뒤 학습된 Perceiver로 풀링되고, MLP로 투영된 후 텍스트 임베딩과 결합되어 교차 시퀀스를 형성합니다. 이는 Idefics1에서 사용된 게이트형 교차‑어텐션을 대체하여 멀티모달 상호작용을 단순화합니다.

학습 데이터

Idefics2는 공개된 데이터셋을 혼합하여 사전 학습되었습니다:

  • Web documents: Wikipedia와 OBELICS 데이터셋(웹 문서에서 추출한 이미지‑텍스트 쌍).
  • Image‑caption pairs: Public Multimodal Dataset와 LAION‑COCO.
  • OCR data: PDF‑A(영어), IDL, Rendered‑Text 데이터셋.
  • Image‑to‑code data: WebSight.

지시 튜닝을 위해 팀은 The Cauldron을 구축했으며, 이는 다중 턴 대화를 위해 형식화된 50개의 수동으로 선별된 멀티모달 지시 데이터셋을 포함하는 공개 컬렉션입니다. Idefics2는 The Cauldron과 표준 텍스트 전용 지시 데이터와 함께 파인튜닝되었습니다.

성능 벤치마크

Idefics2는 8‑B 규모 모델 중 최고 수준의 결과를 달성하며, 훨씬 큰 독점 시스템과도 경쟁합니다. 인기 멀티모달 벤치마크에서 주요 점수(높을수록 좋음)는 다음과 같습니다:

Benchmark Idefics2 (분할 없음) Idefics2 (분할 포함)
MMMU (val/test) 43.5 / 37.9 43.0 / 37.7
MathVista (test‑mini) 51.6 51.4
TextVQA (val) 70.4 73.0
MMBench (test) 76.8 76.7
VQAv2 (test‑dev) 80.8 81.2
DocVQA (test) 67.3 74.0

이 결과는 Idefics2가 DeepSeek‑VL, LLaVA‑NeXT‑Mistral‑7B, LLaVA‑NeXT‑13B와 같은 다른 오픈 7‑B/13‑B 모델보다 앞서며, Gemini 1.5 Pro와 Claude 3 Haiku와 같은 폐쇄형 대형 모델과도 근접한 성능을 보임을 의미합니다.

Idefics1 대비 새로운 기능

  • Native‑resolution vision: NaViT 스타일로 최대 980 × 980 이미지 처리 시 디테일과 종횡비를 유지합니다.
  • Enhanced OCR: OCR에 특화된 통합 학습 데이터를 통해 이미지, 차트, 문서 내 텍스트 전사 정확도가 향상됩니다.
  • Simplified fusion: 게이트형 교차‑어텐션을 Perceiver 풀링 및 MLP 투영으로 교체하여 더 깔끔한 아키텍처와 빠른 추론을 제공합니다.
  • Sub‑image splitting: 선택적인 4방향 분할을 통해 매우 큰 이미지를 성능 저하 없이 처리할 수 있습니다.

이러한 업그레이드들을 종합하면 모델이 전 버전보다 10배 작음에도 불구하고 성능이 크게 향상되었습니다.

시작하기

Idefics2는 Hugging Face Hub에 호스팅되어 있으며 최신 transformers 릴리스에서 바로 지원됩니다. 다음 Python 코드 조각은 기본 사용법을 보여줍니다:

import torch
from PIL import Image
from transformers import AutoProcessor, AutoModelForVision2Seq, load_image

DEVICE = "cuda:0"

# Load example images
image1 = load_image("https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg")
image2 = load_image("https://cdn.britannica.com/59/94459-050-DBA42467/Skyline-Chicago.jpg")

processor = AutoProcessor.from_pretrained("HuggingFaceM4/idefics2-8b")
model = AutoModelForVision2Seq.from_pretrained("HuggingFaceM4/idefics2-8b").to(DEVICE)

messages = [
    {"role": "user", "content": [{"type": "image"}, {"type": "text", "text": "What do we see in this image?"}]},
    {"role": "assistant", "content": [{"type": "text", "text": "In this image, we can see the Statue of Liberty in New York."}]},
    {"role": "user", "content": [{"type": "image"}, {"type": "text", "text": "And how about this image?"}]},
]

prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
inputs = processor(text=prompt, images=[image1, image2], return_tensors="pt")
inputs = {k: v.to(DEVICE) for k, v in inputs.items()}

generated_ids = model.generate(**inputs, max_new_tokens=200)
print(processor.batch_decode(generated_ids, skip_special_tokens=True)[0])

저자들은 맞춤 데이터에 대한 Idefics2 파인튜닝을 위한 Colab 노트북도 제공했습니다.

리소스

  • Model cards: idefics2-8b, idefics2-8b-base, idefics2-8b-chatty
  • Datasets: The Cauldron, OBELICS, WebSight
  • Demo spaces: Hugging Face Spaces의 인터랙티브 플레이그라운드
  • Paper: arXiv pre‑print 2405.02246

라이선스

Idefics2 가중치는 Apache 2.0 라이선스로 출시되었으며, 이는 기반이 되는 Mistral‑7B와 SigLIP 백본과 일치합니다.


커뮤니티에 대한 시사점

고성능의 완전 오픈소스 8‑B 비전-언어 모델 출시로 멀티모달 AI 연구와 제품 개발 장벽이 낮아집니다. 모델과 선별된 지시 데이터셋을 모두 제공함으로써 Hugging Face는 대형 독점 시스템의 라이선스 제약 없이 빠른 프로토타이핑, 파인튜닝 및 벤치마킹을 가능하게 합니다. 아키텍처 단순화와 원시 해상도 처리 방식은 향후 오픈 모델에서 효율적인 멀티모달 융합을 위한 새로운 기준을 제시합니다.

Sources