적대적 예시를 사용한 머신 러닝 공격

TL;DR

적대적 예시는 머신 러닝 모델이 실수를 하게 하는 의도적으로 설계된 입력으로, 기계에 대한 '광학적 환상' 역할을 합니다. 이들의 존재는 심지어 간단한 현대 알고리즘도 설계자가 의도하지 않은 방식으로 동작할 수 있음을 보여주며, AI 안전에 대한 구체적이고 시급한 과제를 제시합니다.

Understanding Adversarial Examples

적대적 예시는 머신 러닝 모델이 데이터를 잘못 분류하거나 잘못된 행동을 하도록 특별히 조작된 입력입니다. 이러한 교란은 종종 인간이 느끼기 어려울 정도로 미세하지만 AI 시스템에 대해 매우 효과적입니다.

Cross-Medium Vulnerabilities

적대적 공격은 강력하며 다양한 형식으로 나타날 수 있습니다:

  • 디지털 이미지: 판다 이미지에 작은 교란을 추가하면 모델이 높은 신뢰도로 이를 깡총이(기본적으로 gibbon)로 인식하게 할 수 있습니다.
  • 물리적 세계: 적대적 예시는 일반 종이에 인쇄되어 스마트폰으로 촬영될 수 있으며, 여전히 분류기를 성공적으로 속일 수 있습니다(예: '세탁기'를 '안전'으로 라벨링).
  • 중요 인프라: 공격자는 스티커나 페인트를 사용하여 정지 표지판을 잠재적으로 수정할 수 있으며, 이로 인해 자율 주행 차량이 이를 '양보' 표지판이나 다른 마커로 해석할 수 있습니다.

Impact on Reinforcement Learning (RL)

이미지 분류를 넘어, 강화 학습 에이전트도 취약합니다. DQN, TRPO, A3C 알고리즘을 포함한 연구에 따르면, 적대적 입력은 성능을 저하시켜 에이전트가 퐁 패들을 잘못된 방향으로 움직이게 하거나, 인간 인지로는 미미한 교란이라도 Seaquest에서 적을 발견하지 못하게 할 수 있습니다.

Attempted Defenses and Their Limitations

무게 감소와 드롭아웃과 같은 전통적인 강건성 기법은 일반적으로 적대적 예시에 대해 효과가 없습니다. 오직 두 가지 특수 방법만이 상당한 방어를 제공했으나, 두 방법 모두 공격자의 증가된 계산 능력에 여전히 취약합니다.

Effective Defense Strategies

  • 적대적 훈련: 모델이 적대적 예시에 속지 않도록 대량의 생성된 적대적 예시에서 명시적으로 훈련하는 무차별 대입 방식입니다.
  • 방어적 증류: 모델이硬결정 대신 다양한 클래스의 확률을 출력하도록 훈련되는 전략입니다. 이러한 확률은 동일한 작업에서 훈련된 이전 모델이 제공하며, 이는 모델의 표면을 부드럽게 만들어 공격자가 악용할 수 있는 tweaks를 찾기 어렵게 만듭니다.

The Failure of Gradient Masking

"그라디언트 마스킹"은 공격자가 유용한 그라디언트에 접근하지 못하도록 시도하는 실패한 방어 범주를 설명합니다. 대부분의 공격은 잘못된 클래스의 확률을 높이기 위해 입력을 교란할 방향을 결정하기 위해 모델의 그라디언트를 사용하므로, 그라디언트를 마스킹하는 것(예: 확률 대신 가장 가능성 높은 클래스만 출력)은 효과적으로 보입니다.

그러나 그라디언트 마스킹은 다음과 같은 이유로 실패합니다:

  1. 취약점의 지속성: 모델의 방어에 있는 '구멍'은 여전히 존재하며, 공격자는 단순히 이를 찾는 단서가 적어집니다.
  2. 대체 모델: 공격자는 방어된 모델의 레이블을 관찰하여 모방하는 부드러운 복사본인 '대체 모델'을 훈련시킬 수 있습니다. 공격자는 затем 대체 모델의 그라디언트를 사용하여 적대적 예시를 생성하며, 이는 종종 원래 방어된 모델을 성공적으로 속입니다.

OpenAI는 적대적 훈련과 방어적 증류가 모두 그라디언트 마스킹의 한 형태를 우연히 수행한다고 지적하며, 이는 더 많은 포인트가 올바르게 분류되도록 보장하기보다는 모델을 평평하게 만드는 경향이 있습니다.

Why Defending Against Adversarial Examples is Difficult

적대적 공격에 대한 ML 모델 보안은 몇 가지 근본적인 이유로 복잡한 연구 문제입니다:

  • 이론적 모델 부족: 적대적 예시는 비선형 및 비볼록 최적화 문제의 해입니다. 이러한 해를 설명할 수 있는 이론적 도구가 적기 때문에, 특정 적대적 예시 집합을 배제하는 방어를 증명하기 어렵습니다.
  • 입력 공간 복잡성: 모델은 모든 가능한 입력에 대해 올바른 출력을 생성해야 하지만, 현재 대부분의 모델은 마주칠 수 있는 모든 가능한 입력 중 매우 작은 부분에서만 잘 작동합니다.
  • 비적응적 방어: 대부분의 현재 전략은 적응적이지 않습니다; 특정 공격을 차단할 수 있지만 방어 메커니즘을 인지한 공격자에게 다른 취약점을 열어둘 수 있습니다.

Sources