CLIP의 멀티모달 뉴런

OpenAI는 CLIP 모델 내에서 사진처럼 현실적인 이미지, 스케치, 또는 écrits 텍스트 형태로 제시되든 단일지 제시되든 관계없이 단일 개념에 반응하여 활성화되는 "멀티모달 뉴런"을 식별했습니다. 이 발견은 CLIP이 인간 뇌와 유사한 추상화 메커니즘을 활용한다는 것을 시사하며, 동일한 객체의 다양한 시각적 표현을 분류할 수 있는 능력을 설명합니다.

멀티모달 뉴런과 의미적 불변성

CLIP은 특정 시각적 특징보다는 의미적 아이디어 클러스터에 반응하는 뉴런을 포함합니다. 이는 인간 뇌의 "할리 베리" 뉴런과 같은 생물학적 발견을 반영하는데, 이 뉴런은 사진, 스케치, 그리고 여배우의 écrits 이름에 반응합니다.

CLIP에서 OpenAI는 "스파이더맨" 뉴런(CLIP RN50x4의 마지막 이전 레이어의 뉴런 244)을 식별했는데, 이 뉴런은 다음에 반응합니다:

  • 복장을 한 스파이더맨의 사진처럼 현실적인 이미지
  • 실제 거미의 이미지
  • 스파이더맨의 만화책 일러스트
  • "spider"라는 écrits 텍스트

특성 시각화와 데이터셋 예를 사용하여 연구자들은 CLIP RN50x4의 대부분의 뉴런이 해석 가능하며 높은 수준의 추상에서 여러 distinct 사례에 반응하는 "다면적 뉴런"として機能することを発見しました。これには、感情、動物、著名人、芸術スタイル、さらにはデジタル変更のためのニューロンが含まれます。

구성 및 분류

CLIP은 이러한 고레벨 멀티모달 뉴런을 조합하여 분류를 수행합니다. 희소 선형 프로브는 최종 분류가 종종 여러 개념적 뉴런의 조합 결과임을 보여줍니다.

  • 시각적 구성: "저금통"의 분류는 "금융" 뉴런과 "도자기" 뉴런을 결합하여 달성됩니다. 마찬가지로, "스파이더맨" 뉴런은 "헛간 거미"의 분류에 기여합니다.
  • 텍스트 구성: 언어에서 개념은 거의 선형적으로 동작합니다. 예를 들어, 모델은 "놀란"이라는 단어를 "충격"과 "축하/포옹"의 조합으로 해석합니다.

그러나 이 환원적 접근법은 누락을 초래할 수 있습니다. 모델의 "친밀함"에 대한 이해는 "부드러운 미소"와 "하트"를 포함하지만 명시적으로 "질병"을 빼서 질병의 맥락에서의 친밀함을 고려하지 못합니다.

"부재 개념" 문제

CLIP의 모든 기능이 단일 해석 가능한 뉴런으로 표현되는 것은 아닙니다. CLIP은 샌프란시스코의 특정 동네인 "트윈 피크스"까지 정확한 지리 위치 파악을 수행할 수 있지만, 연구자들은 특정 "샌프란시스코" 뉴런을 찾을 수 없었습니다. 이는 일부 정보가 이산 뉴런이 아닌 방향이나 복잡한 다양체로 인코딩되어 있음을 시사합니다.

취약점: 타이포그래픽 공격

모델의 고레벨 추상에 대한 의존은 "타이포그래픽 공격"이라는 새로운 공격 벡터를 만듭니다. CLIP의 멀티모달 뉴런이 literal과 iconic 표현 전반에 걸쳐 일반화하기 때문에, écrits 텍스트 이미지로도 트리거될 수 있습니다.

예를 들어, "금융" 뉴런은 저금통과 "$$$"이라는 écrits 텍스트 모두에 반응합니다. 표준 푸들 이미지에 "$$$" 문자열을 추가함으로써 모델은 개를 저금통으로 분류하도록 속일 수 있습니다. 이러한 공격은 실용적이며 펜과 종이로 물리적 객체에 écrits 텍스트를 써서 간단히 실행할 수 있습니다.

편향과 과일반화

CLIP은 인터넷 규모 훈련 데이터의 편향을 물려받으며, 이는 뉴런 내의 문제적 연관으로 나타납니다:

  • 지역적 편향: "중동" 뉴런은 테러와 연관되어 있고, "이민" 뉴런은 라틴 아메리카에 반응합니다.
  • 표현적 해악: 하나의 뉴런이 고릴라와 어두운 피부를 가진 사람 모두에 대해 발화하는 것이 발견되었습니다.
  • 해상도 차이: 미국과 인도 같은 국가의 뉴런은 잘 정의되어 있지만, 아프리카 국가의 뉴런은 특정 국가보다는 전체 지역에 반응하는 경향이 있습니다.

OpenAI는 practitioners가 배포 전에 이러한 편향을 사전에 방지하기 위해 해석 도구가 필수적이라고 제안합니다. 왜냐하면 표준 테스트로는 이러한 편향을 예상하거나 측정하기 어려울 수 있기 때문입니다.

연구 도구 및 모델 릴리스

멀티모달 시스템에 대한 추가 연구를 촉진하기 위해 OpenAI는 CLIP RN50x4와 RN101의 가중치를 공개했습니다. 또한, OpenAI Microscope 카탈로그가 업데이트되어 CLIP RN50x4의 모든 뉴런에 대한 특성 시각화, 데이터셋 예시, 및 텍스트 특성 시각화가 포함되었습니다.

Sources