PaliGemma 2 릴리스 노트

Google은 PaliGemma 2를 출시했습니다. 이는 최신 Gemma 2 텍스트 디코더와 SigLIP 이미지 인코더를 통합한 비전 언어 모델(VLM)의 새로운 반복 버전입니다. 이 업데이트는 단일 3B 변형에서 세 가지 다른 크기로 모델 가족을 확장하고, 다운스트림 파인튜닝에서 품질과 효율성을 더 잘 균형 잡을 수 있도록 여러 입력 해상도 옵션을 도입합니다.

모델 아키텍처 및 변형

PaliGemma 2는 컴팩트한 SigLIP 이미지 인코더를 Gemma 2 언어 모델에 연결합니다. 사용 가능한 변형은 Gemma 2 2B, 9B, 27B 모델을 기반으로 하며, 이로 인해 PaliGemma 2의 크기는 3B, 10B, 28B 매개변수(이미지 인코더의 매개변수 포함)가 됩니다.

다양한 사용 사례에 유연성을 제공하기 위해 각 모델 크기는 세 가지 입력 해상도를 지원합니다:

  • 224x224
  • 448x448
  • 896x896

모든 체크포인트는 bfloat16 정밀도로 제공되며, Gemma 라이선스 하에 배포되어 상업적 사용, 재배포, 모델 파생물 생성을 허용합니다.

사전 학습 데이터 및 기능

사전 학습된(pt) 모델은 다운스트림 작업에서 쉽게 파인튜닝할 수 있도록 설계되었습니다. 이들은 다양한 데이터 혼합물로 학습되어 적은 예시로도 높은 성능 적응을 가능하게 합니다. 사전 학습 데이터 세트는 다음과 같습니다:

  • WebLI: 시각적 의미 이해, 객체 위치 파악, 다국어성을 위한 다국어 웹 규모 이미지-텍스트 데이터셋.
  • CC3M-35L: Google Cloud Translation API를 통해 34개 추가 언어로 번역된 영어 이미지-alt_text 쌍.
  • VQ2A: 34개 추가 언어로 번역된 개선된 질문-답변 데이터셋.
  • OpenImages: OpenImages 데이터셋에서 생성된 감지 및 객체 인식 Q&A.
  • WIT: Wikipedia에서 출처를 찾은 이미지와 텍스트.

특화된 파인튜닝 변형: DOCCI

Google은 448x448 해상도의 3B 및 10B 모델에 대해 DOCCI 데이터셋(이미지-텍스트 캡션 쌍)에서 파인튜닝된 특정 변형을 출시했습니다. 이러한 모델은 텍스트 렌더링, 공간 관계 포착, 세계 지식 통합을 포함한 강력한 캡션 기능을 보여줍니다.

기술 보고서에 따르면, PaliGemma 2는 이전 버전 및 다른 모델과 비교하여 사실 정확도(Non Entailment Sentences 또는 NES로 측정)가 향상되었습니다:

모델 매개변수 평균 문자 수 평균 문장 수 NES (낮을수록 좋음)
PaliGemma 3B 535 8.9 34.3
PaliGemma 2 (3B) 3B 529 7.7 28.4
PaliGemma 2 (10B) 10B 521 7.5 20.3
VILA 7B 871 8.6 28.6
LLaVA-1.5 7B 395 4.2 40.6

배포 및 양자화

PaliGemma 2는 transformers 라이브러리(버전 4.47 이상)와 PaliGemmaForConditionalGenerationAutoProcessor API를 사용하여 Hugging Face와 통합되었습니다.

TextVQA 데이터셋(224x224 해상도)에서 3B 파인튜닝 체크포인트를 사용한 테스트 결과, 양자화가 정확도에 미치는 영향은 미미합니다:

  • bfloat16 (양자화 없음): 60.04% 정확도
  • 8-bit: 59.78% 정확도
  • 4-bit (nf4): 58.72% 정확도

파인튜닝 및 구현

PaliGemma 2의 파인튜닝 API는 원래 PaliGemma와 동일하게 유지되어 기존 코드가 그대로 작동합니다. Hugging Face 팀은 세 개의 A100(80GB) GPU를 사용하여 VQAv2 검증 세트의 일부에서 PaliGemma 2 3B 모델을 LoRA 파인튜닝하여 30분 만에 모델의 효율성을 입증했습니다.

Sources