Google DeepMind 시각 정렬 연구

Google DeepMind은 AI 시각 표현을 인간 개념 계층 구조에 맞춰 정렬하는 방법을 도입하여 모델이 표면적 특징에 의존하는 경향을 줄이고 일반화 능력을 향상시켰습니다. 이 연구는 모델의 시각 세계 내부 지도를 재구성함으로써 시스템이 더 견고하고 신뢰할 수 있으며 few-shot learning과 같은 작업에서 더 나은 성능을 보임을 보여줍니다.

AI와 인간 시각 사이의 불일치

AI 시각 모델은 종종 인간과 동일한 개념 렌즈를 통해 세계를 인식하지 못합니다. 인간은 시각 정보를 계층적으로 조직하여—예를 들어 자동차와 비행기가 모두 큰 금속 차량임을 인식하는 것처럼—AI 모델은 종종 배경 색상이나 질감과 같은 표면적 특징에 집중합니다.

이 격차를 측정하기 위해 연구자들은 인지 과학의 "이상한 것 찾기" 작업을 사용했는데, 여기서 피험자는 세 이미지 중 하나가 맞지 않는 것을 식별해야 합니다. 결과는 체계적인 불일치를 보여주었습니다: 인간이 답에 강하게 동의하는 경우, AI 모델은 고수준 개념 범주보다 저수준 시각 패턴을 우선시하기 때문에 종종 잘못된 선택을 합니다.

시각 표현을 위한 세 단계 정렬 방법

인간 판단 데이터셋에 모델을 직접 미세 조정하면 데이터셋이 너무 작아서 과적합이 자주 발생합니다. 이를 극복하기 위해 Google DeepMind은 사전 지식을 잃지 않고 모델 표현을 재구성하는 세 단계 과정을 개발했습니다:

  1. 교사 모델 생성: THINGS 데이터셋을 사용하여 사전 훈련된 비전 모델(SigLIP-SO400M) 위에 작은 어댑터를 훈련시켰습니다. 메인 모델을 동결하고 어댑터를 정규화함으로써 연구자들은 원래 훈련을 잊지 않으면서 인간과 유사한 판단을 모방하는 '교사' 모델을 만들었습니다.
  2. 합성 데이터셋 생성: 이 교사 모델을 사용하여 AligNet이라는 수백만 개의 서로 다른 이미지에 걸친 인간과 유사한 이상한 것 찾기 결정 수백만 개를 포함하는 대규모 데이터셋을 생성했습니다.
  3. 학생 모델 미세 조정: 다른 AI 모델('학생')은 AligNet 데이터셋을 사용하여 미세 조정되었습니다. 이 데이터의 다양성은 과적합을 방지하고 학생들이 내부 표현 지도를 깊게 재구성하도록 허용했습니다.

결과적으로, 학생 모델의 내부 지도는 구조 없는 덩어리에서 고수준 개념(예: 동물 vs. 음식)이 명확히 분리된 조직된 클러스터로 이동했습니다.

모델 성능과 신뢰성에 미치는 영향

AI 표현을 인간 개념 계층 구조에 맞추다면 인지적 및 기술적 성능 모두에서 측정 가능한 향상이 이루어집니다:

인간 정렬 개선

정렬된 모델은 이상한 것 찾기 작업과 다중 배열 작업(유사도에 따라 이미지 배열)에서 인간 판단과 유의미하게 더 높은 일치를 보였습니다. 연구자들은 이러한 향상을 더욱 검증하기 위해 Levels라는 새로운 데이터셋도 도입했습니다.

인간과 유사한 불확실성

정렬된 모델은 인간 행동과 상관관계를 갖는 불확실성의 형태를 개발했는데, 구체적으로 model-decision-uncertainty가 인간이 선택을 하는 데 걸리는 시간과 강하게 상관관계를 보였습니다.

일반화 및 견고성 향상

모델을 더 인간과 맞추다면 표준 AI 벤치마크에서의 성능이 향상되었으며, 다음을 포함합니다:

  • Few-shot learning: 단일 이미지에서 새로운 범주를 학습할 수 있는 능력.
  • Distribution shift: 테스트 중인 이미지 유형이 변경되어도 신뢰할 수 있는 결정을 내릴 수 있는 능력.

결론

시각 모델의 내부 표현 지도를 인간 개념 계층 구조에 따라 재구성함으로써 Google DeepMind은 AI가 더 직관적이고 신뢰할 수 있게 될 수 있음을 보여주었습니다. 이 접근 방식은 표면적 노이에 더 견고하고 다양한 시각 환경에서 더 잘 일반화할 수 있는 시각 시스템을 구축하기 위한 확장 가능한 경로를 제공합니다.

Sources