SigLIP 2 릴리스 노트 / 새로운 기능

Google은 SigLIP 2를 출시했습니다. 이는 향상된 의미 이해, локализа션, 및 밀집 특징 추출을 위한 추가 학습 목표를 도입하여 원본 SigLIP을 개선한 새로운 다언어 비전-언어 인코더 가족입니다. SigLIP 2는 이미지-텍스트 검색, 제로샷 분류, 및 Vision-Language Models(VLM)의 전이 성능과 같은 핵심 기능에서 모든 모델 규모에서 이전 버전보다 뛰어납니다.

локализа션과 의미를 위한 향상된 학습 목표

SigLIP 2는 원본 SigLIP의 시그모이드 손실에 세 가지 주요 기술적 개선을 추가하여 더 구조화되고 세밀한 시각적 표현을 만듭니다.

텍스트 디코더 통합

시각 인코더가 위치 정보를 인식하도록 하기 위해 학습 과정에 텍스트 디코더가 추가됩니다. 이 디코더는 다음과 같은 세 가지 특정 목표를 갖습니다:

  1. 전체 이미지 캡션 예측.
  2. 특정 이미지 영역을 설명하는 캡션이 제공될 때 경계 상자 좌표 예측.
  3. 경계 상자 좌표가 제공될 때 영역별 캡션 예측.

로컬 의미를 위한 자체 증류

세밀한 로컬 의미를 향상시키기 위해 SigLIP 2는 학생의 파라미터의 이동 평균인 교사가 있는 교사-학생 프레임워크를 사용하여 자체 증류를 활용합니다. 두 가지 특정 손실이 도입됩니다:

  • 글로벌-로컬 손실: 학생 네트워크는 해당 이미지의 부분(로컬) 보기만 보며 전체 이미지의 교사 표현과 일치하도록 훈련됩니다.
  • 마스킹 예측 손실: 학생은 임베디드 이미지 패치의 50%가 마스킹된 위치에서 교사의 특징과 일치해야 합니다.

인코더에 부정적인 영향을 방지하고 계산 비용을 줄이기 위해, 이러한 자체 증류 손실은 시그모이드와 디코더 손실을 사용하는 훈련의 80%가 완료된 후에만 적용됩니다.

해상도 적응 및 NaFlex 변형

SigLIP 2는 두 가지 distinct 방법론을 통해 종횡비와 해상도에 대한 민감성을 해결합니다:

  • 고정 해상도: 훈련 과정의 95% 체크포인트를 사용하여 위치 및 패치 임베딩의 크기를 조정한 후, 대상 해상도를 위한 훈련을 계속합니다.
  • 동적 해상도 (NaFlex): FlexiViT와 NaViT를 기반으로, naflex 변형은 서로 다른 시퀀스 길이와 네이티브 종횡비를 가진 입력을 지원합니다.これにより 단일 모델을 OCR 및 문서 이해와 같이 요구 사항이 다양한 작업에 사용할 수 있습니다.

사용자는 표준 SiglipModel 클래스를 사용하여 고정 해상도 모델을 활용할 수 있으며, naflex 변형은 Siglip2Model 클래스가 필요합니다(ただし、Hugging Face 파이프라인 API를 통해 자동으로 처리됩니다).

모델 가족 및 성능

SigLIP 2는 원본 SigLIP보다 더 넓은 범위의 모델 크기와 구성을 도입하며, 새로운 'Giant'(1B) 시리즈도 포함됩니다. 사용 가능한 모델은 다음과 같습니다:

크기 패치 크기 해상도
Base (86M) 32 / 16 224 to 512 / NaFlex
Large (303M) 16 256 to 512
Shape Optimized 400M 14 / 16 224 to 512 / NaFlex
Giant (1B) 16 256 to 384

평가 데이터에 따르면, SigLIP 2는 이러한 모든 규모에서 SigLIP 1보다 우수합니다. 이러한 인코더는 VLM 구축에 특히 유용합니다; 예를 들어, PaliGemma 2 모델은 SigLIP과 Gemma 2 LLM을 통합하며, SigLIP 2는 유사한 아키텍처에 대한 잠재적인 업그레이드 경로를 제공합니다.

구현 및 추론

추론은 transformers 라이브러리를 사용하여 수행할 수 있습니다. SigLIP 2 지원을 위해 사용자는 메인 브랜치 또는 특정 안정 브랜치에서 transformers를 설치해야 합니다: pip install git+https://github.com/huggingface/transformers@v4.49.0-SigLIP-2.

일반적인 사용 사례에는 pipeline API를 통한 제로샷 이미지 분류 및 다운스트림 작업을 위한 AutoModelAutoProcessor를 사용한 이미지 임베딩 추출이 포함됩니다.

Sources