Chinese CLIP: 중국어 대비 비전-언어 사전학습

Qwen은 중국어를 위해 비전과 언어 사이의 격차를 메우도록 설계된 대비 비전-언어 사전학습 모델인 Chinese CLIP을 소개했습니다. 이 모델은 기계 번역이나 다국어 CLIP 변형에 의존하는 기존 멀티모달 모델들의 한계를 해결합니다. 이러한 모델들은 종종 중국 고유의 문화적 개념과 원시 데이터 분포를 제대로 다루지 못합니다.

언어별 CLIP이 필요한 이유

표준 CLIP 모델 및 다국어 버전은 종종 중국 문화와 사회적 풍경의 미묘한 차이를 포착하지 못합니다. Qwen은 기존 접근 방식에서 두 가지 주요 실패 지점을 확인했습니다.

  • Translation Degradation: 원본 CLIP에 기계 번역을 결합해 중국어 텍스트를 처리하면, 원어 중국어 사전학습에 비해 성능이 크게 저하됩니다.
  • Cultural Bias: mCLIP과 같은 다국어 모델은 중국 고유의 개념을 이해하는 데 어려움을 겪으며, 종종 서구 문화와 연관된 항목을 검색해 원시 중국어 맥락을 놓칩니다.

두 단계 사전학습 방법론

CLIP의 역량을 중국어에 효율적으로 이전하기 위해, Qwen은 처음부터 학습하는 대신 두 단계 사전학습 방법을 사용합니다. 연구진은 이를 보다 비용 효율적인 접근법이라고 설명합니다.

단계 1: 언어 인코더 튜닝

첫 번째 단계에서는 모델이 두 개의 타워를 초기화합니다: 원본 CLIP에서 가져온 비전 인코더(예: ViT-B 또는 ResNet)와 언어 인코더로서의 중국어 RoBERTa(RoBERTA-wwm-Chinese). 비전 인코더는 고정하고, 언어 인코더는 대비 방식으로 튜닝되어 그 표현을 CLIP 비전 인코더의 출력 공간에 매핑합니다.

단계 2: 공동 파인튜닝

두 번째 단계에서는 비전 인코더의 고정이 해제됩니다. 비전 인코더와 언어 인코더가 함께 대비 방식으로 튜닝됩니다. 이를 통해 비전 인코더는 중국 데이터에 존재하는 이미지 분포에 적응하여 지역 문화적 가치와 시각적 특성을 포착합니다.

학습 데이터 및 모델 변형

이 모델은 약 2억 개의 이미지-텍스트 쌍으로 사전학습되었습니다. 재현성을 보장하기 위해 팀은 주로 공개 데이터셋을 사용했으며, 포함된 데이터는 다음과 같습니다:

  • LAION-5B의 중국어(zh) 부분
  • Wukong 데이터셋
  • MSCOCO와 Visual Genome에서 번역된 데이터

Qwen은 다양한 성능 및 효율 요구를 충족시키기 위해 다섯 가지 모델 변형을 공개했습니다:

  • ResNet-50
  • ViT-B/16
  • ViT-L/14
  • ViT-L/14 @336px
  • ViT-H/14

성능 및 벤치마크

Chinese CLIP은 특히 원시 중국어 데이터셋에서 여러 검색 및 분류 작업에 걸쳐 우수한 성능을 보여줍니다.

교차 모달 검색

세 개의 데이터셋(MUGE(중국어 원시 데이터셋), Flickr30K-CN, COCO-CN(영어 원시 데이터셋))에 대해 실험을 수행했습니다. Chinese CLIP은 세 데이터셋 모두에서 이전 최고 모델을 능가했으며, 특히 MUGE 데이터셋에서 가장 큰 성능 차이를 보였는데, 이는 원시 중국어 데이터를 처리하는 강력한 능력을 나타냅니다.

제로샷 이미지 분류

수동으로 번역된 라벨과 프롬프트를 사용한 ELEVATER 벤치마크에서 Chinese CLIP은 경쟁력 있는 성능을 달성했으며, 영어 원시 벤치마크에서도 그 효과를 입증했습니다.

소거 실험 결과

소거 실험을 통해 두 단계 사전학습 접근법이 처음부터 학습하는 것보다 훨씬 효과적이며, 두 번째 단계 튜닝이 교차 모달 검색 성능을 추가로 향상시킴을 확인했습니다.

향후 방향

Chinese CLIP이 검색 및 분류에 효과적이지만, 연구진은 이를 비전 기반 모델로서의 역할을 더욱 검증하고자 합니다. 향후 작업은 중국어 멀티모달 및 비전 표현 학습을 위한 전용 벤치마크 구축에 초점을 맞출 예정입니다.

Sources