PaliGemma 2 Mix 릴리스 노트

Google은 PaliGemma 2 mix를 출시했습니다. 이는 사전 학습된 PaliGemma 2 체크포인트의 성능 능력을 보여주기 위해 다양한 학술 데이터셋에서 미세 조정된 명령 튜닝된 비전 언어 모델(VLM)의 가족입니다. 원래의 사전 학습된 PaliGemma 2 (pt) 모델은 특정 다운스트림 작업에 대한 전이 학습의 기본 모델로 의도되었지만, 믹스 변형은 다양한 비전 언어 애플리케이션에 대한 다용도 기본 모델을 제공합니다.

모델 아키텍처 및 변형

PaliGemma 2는 SigLIP 비전 인코더와 Gemma 2 언어 모델을 기반으로 구축되었습니다. 믹스 가족은 성능과 계산 효율성을 균형 있게 유지하기 위해 세 가지 파라미터 크기와 여러 해상도로 제공됩니다:

파라미터 수 해상도 옵션
3B 224x224, 448x448
10B 224x224, 448x448
28B 224x224, 448x448

모델은 Hugging Face Transformers 및 JAX 프레임워크 모두에서 사용할 수 있습니다.

핵심 기능 및 작업 지원

PaliGemma 2 mix 모델은 비전 언어 작업의 네 가지 주요 범위를 처리할 수 있습니다:

  • 일반 비전-언어 작업: 시각 질문 응답(VQA) 및 이미지 참조를 포함합니다.
  • 문서 이해: 인포그래픽, 차트, 다이어그램에 초점을 맞춘 VQA.
  • 텍스트 인식(OCR): 텍스트 감지, 텍스트가 포함된 이미지 캡션 생성, 텍스트가 많은 이미지에 대한 VQA.
  • 위치 결정: 객체 감지 및 이미지 분할.

프롬프트 전략

PaliGemma 2 mix는 더 나은 성능을 위해 개방형 프롬프트를 지원하지만, 이전 버전에서 사용된 작업별 프리픽스와 호환성을 유지합니다.

개방형 프롬프트는 대부분의 작업에 권장됩니다. 그러나 작업 프리픽스는 여전히 기능적이며 다음 패턴을 따릅니다:

  • caption {lang}: 짧고 COCO와 유사한 캡션.
  • describe {lang}: 상세하고 설명적인 캡션.
  • ocr: 광학 문자 인식.
  • answer {lang} {question}: 이미지 내용에 대한 질문 응답.
  • question {lang} {answer}: 주어진 답변을 기반으로 질문 생성.

필수 프리픽스: 객체 감지 및 이미지 분할이 작동하려면 특정 프리픽스가 필요합니다:

  • detect {object description}: 나열된 객체에 대한 경계 상자를 반환합니다.
  • segment {object description}; {object description}: 지정된 객체에 대한 이미지 분할을 생성합니다.

성능 비교 및 평가

448x448 해상도의 3B 및 10B 변형에 대한 평가는 더 큰 모델이 일반적으로 더 정확하고 상세한 응답을 제공함을 보여주며, 특히 복잡한 추론 및 문서 이해에서 그렇습니다.

  • 일반 VQA: 3B 및 10B 모델 모두 객체(예: 사탕 세기)를 정확히 세고 설명적인 장면 분석을 제공합니다.
  • 문서 이해: 10B 모델은 해상도에 민감한 작업에서 더 높은 정확도를 보여주며, 최적의 변형(448px)을 정확히 식별하는 반면, 3B 모델은 덜 정확한 응답을 제공했습니다.
  • 텍스트 인식: 두 모델 모두 강력한 OCR 기능을 보여주며, 이미지에서 날짜, 가격, 복잡한 메뉴 텍스트를 정확히 추출합니다.
  • 위치 결정: 모델은 간단한 클래스 라벨에 제한되지 않고, 설명적인 프롬프트(예: "가지에 앉은 새))를 기반으로 객체를 감지하고 분할할 수 있습니다.

구현 및 미세 조정

PaliGemma 2 mix는 Hugging Face transformers 라이브러리를 사용하여 구현할 수 있습니다. 이 과정은 입력 처리를 위해 PaliGemmaProcessor를 사용하고, 모델 로딩 및 $ ext{bfloat16}$ 정밀도를 위해 PaliGemmaForConditionalGeneration를 사용합니다.

모델을 추가로 맞춤 설정하려는 사용자는 사전 학습된 PaliGemma 2 모델과 동일한 방법론을 사용하여 믹스 체크포인트를 미세 조정할 수 있습니다. 자세한 튜토리얼은 smol-vision GitHub 저장소를 통해 제공됩니다.

Sources