원격 탐사 및 위성 이미지를 위한 CLIP 미세 조정

연구원들은 위성 이미지와 캡션을 사용하여 OpenAI의 CLIP 모델을 미세 조정하였으며, 이를 통해 원격 탐사 분야에서 고성능 검색을 위해서는 도메인 특화 미세 조정이 필수적임을 입증했습니다. 결과적으로 도출된 모델은 항공 사진을 해당 텍스트 설명과 매칭하는 데 있어 베이스라인 CLIP 모델보다 훨씬 뛰어난 성능을 보여주었습니다.

기술적 접근 방식 및 모델 아키텍처

이 프로젝트는 openai/clip-vit-base-patch32 모델의 미세 조정된 버전을 활용했습니다. 아키텍처는 텍스트 인코더와 이미지 인코더를 사용하는 듀얼 인코더 시스템을 채택하여, 대조 학습(contrastive learning)을 통해 두 모달리티를 공동 임베딩 공간으로 매핑합니다. 이 공간에서 일치하는 이미지-캡션 쌍은 서로 가까워지도록 밀어넣어지고, 일치하지 않는 쌍은 서로 멀어지도록 밀어내집니다.

학습 인프라

학습은 다음 스택을 사용하여 수행되었습니다:

  • Frameworks: Flax와 JAX (자동 미분을 지원하는 선형 대수 라이브러리).
  • Hardware: Google Cloud TPUs.
  • Optimization: 가장 성능이 좋은 모델은 Adam 옵티마이저를 사용하였으며, 학습률(learning rate)은 5e-6, 배치 크기(batch size)는 1024(8개의 TPU 코어에 128씩 분산)였습니다.

데이터셋 및 데이터 증강

위성 이미지의 독특한 visual characteristics를 모델에 적응시키기 위해, 팀은 세 가지 주요 데이터셋을 사용했습니다:

  • RSICD: 주요 데이터셋으로, Google Earth, Baidu Map, MapABC, Tianditu에서 가져온 약 10,000개의 RGB 이미지(224x224)를 포함하며, 이미지당 최대 5개의 캡션이 포함되어 있습니다.
  • UCM: UC Merced Land Use 데이터셋을 기반으로 하며, 2,100개의 이미지를 21개 클래스로 분류하여 각 이미지당 5개의 캡션을 포함합니다.
  • Sydney: 호주 시드니의 이미지 613개를 7개 클래스로 분류하여 각 이미지당 5개의 캡션을 포함합니다.

정규화 전략

이러한 상대적으로 작은 데이터셋에서 과적합(overfitting)을 방지하기 위해, 팀은 두 가지 유형의 증강을 구현했습니다:

  • Image Augmentation: PyTorch Torchvision을 사용하여 무작위 크롭(random cropping), 무작위 크기 조정(random resizing), 색상 지터(color jitter), 무작위 수평 및 수직 뒤집기(random horizontal and vertical flipping)를 활용했습니다.
  • Text Augmentation: Marian MT 모델 제품군을 사용하여 역번역(backtranslation)을 수행했습니다. 캡션은 영어에서 프랑스어, 스페인어, 이탈리아어, 포르투갈어로 번역된 후 다시 영어로 번역되어, 고유한 설명이 5개 미만인 이미지에 대한 캡션의 다양성을 높였습니다.

손실(Loss) 플롯을 통해 이미지 증강이 과적합을 유의미하게 감소시켰으며, 이미지와 텍스트 증강을 모두 결합했을 때 과적합 감소 효과가 가장 컸음을 확인했습니다.

평가 결과

평가는 30개의 이미지 카테고리에 걸친 RSICD 테스트 세트의 하위 집합을 사용하여 수행되었습니다. 모델은 각 이미지에 대해 "An aerial photograph of {category}" 형식의 캡션 30개를 랭킹화하여 top-k 정확도를 측정했습니다.

Model-name k=1 k=3 k=5 k=10
baseline 0.572 0.745 0.837 0.939
Best Model (Adam, lr 5e-6) 0.883 0.968 0.982 0.998

미세 조정된 모델은 베이스라인 대비 상당한 성능 향상을 달성했으며, 특히 k=1에서 정확도가 0.572에서 0.883으로 증가했습니다.

실질적 응용 분야 및 기능

미세 조정된 CLIP 모델은 다음과 같은 여러 원격 탐사 기능을 가능하게 합니다:

  • Text-to-Image Search: 텍스트 쿼리(예: "beach," "airport," 또는 특정 인공 구조물)를 사용하여 대규모 위성 이미지 컬렉션을 검색합니다.
  • Image-to-Image Search: 코퍼스 내에서 시각적으로 유사한 위성 이미지를 찾습니다.
  • Feature Localization: 이미지를 패치(patches)로 나누고 인코딩함으로써, 모델은 특정 텍스트 벡터를 특정 이미지 패치와 매칭하여 특정 영역에 특정 특징이 존재하는 확률을 결정할 수 있습니다.

윤리적 고려 사항

저자들은 이 기술이 기후 변화 모니터링이나 국방과 같은 사회적 선의를 위해 사용될 수 있지만, 동시에 권위주의 국가에 의한 군사 및 경찰 감시를 위한 오용 가능성에 대한 윤리적 우려를 제기합니다.

향후 연구 방향

팀은 다음과 같은 추가 개발 분야를 식별했습니다:

  • Image Captioning: CLIP 인코더와 GPT-3 디코더를 결합한 sequence-to-sequence 모델을 개발합니다.
  • Dataset Expansion: 성능을 더욱 향상시키기 위해 추가적인 이미지-캡션 쌍을 사용하여 미세 조정합니다.
  • Generalization: 미세 조정이 RSICD 데이터가 아닌 다른 데이터에 미치는 영향과 모델이 훈련 세트 외부의 카테고리를 분류하는 능력을 조사합니다.

Sources

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch