OpenAI 예기치 못한 적대적 공격에 대한 강건성 테스트
OpenAI는 신경망 분류기가 훈련 과정에서 보지 못한 적대적 공격에 대해 신뢰할 수 있게 방어할 수 있는지 평가하기 위해 새로운 방법론과 새로운 지표인 예기치 못한 공격 강건성(Unforeseen Attack Robustness, UAR)을 개발했습니다. 이는 표준 신경망이 적대적 예제(adversarial examples)—인간에게는 식별 가능하지만 모델이 확신을 가지고 오분류하게 만드는 작고 정교하게 설계된 왜곡—에 여전히 취약하기 때문에 매우 중요합니다.
예기치 못한 공격 강건성 (UAR) 지표
UAR 지표는 왜곡 유형에 대한 사전 지식을 가진 강력한 방어 모델의 성능과 비교함으로써, 예상치 못한 공격에 대한 단일 모델의 적대적 강건성을 평가합니다. UAR 점수가 100에 가까울수록, 예기치 못한 공격에 대한 모델의 성능이 해당 공격을 방어하도록 특별히 훈련된 방어 모델의 성능과 유사함을 나타내며, 이는 AI 강건성 분야에서 매우 도전적인 목표입니다.
강건성 평가 방법론
OpenAI는 모델이 제외된 왜곡 유형에 대해 어떻게 작동하는지 결정하기 위해 3단계 프로세스를 활용합니다:
1. 다양한 왜곡 유형에 대한 평가
모델을 $L_{\infty}$ 또는 $L_{2}$ 왜곡 유형에 대해서만 평가하는 것은 다른 유형의 공격에 대한 강건성을 예측하는 데 불충분합니다. OpenAI는 연구자들이 훈련 중에 사용된 것과 크게 다른 적대적 왜곡에 대해 모델을 평가할 것을 제안합니다. 다양한 공격을 위한 권장 시작점은 다음과 같습니다:
- $L_{1}$ 왜곡
- $L_{2}$-JPEG 왜곡
- Elastic 왜곡 (로컬 벡터 필드를 따르는 흐름)
- Fog 왜곡 (제한된 크기의 안개와 같은 왜곡)
- Gabor 왜곡 (이미지에 질감을 입히는 데 사용되는 가산 노이즈)
- Snow 왜곡 (적대적으로 구성된 눈송이)
2. 왜곡 크기의 보정
너무 좁은 범위의 왜곡 크기를 사용하면 강건성에 대해 잘못된 질적 결론을 내릴 수 있습니다. OpenAI는 다음 기준에 따라 보정된 왜곡 크기 범위를 선택할 것을 권장합니다:
- 인간의 식별 가능성: 범위는 이미지가 인간에게 식별 가능한 가장 큰 범위여야 합니다.
- 방어 기반 보정: 강력한 방어 모델은 공격자가 성공하기 위해 더 큰 왜곡 예산을 사용하도록 강제하기 때문에, 왜곡 크기는 적대적 훈련을 거친 모델을 대상으로 평가함으로써 보정되어야 합니다.
3. 적대적 훈련 모델과의 벤치마킹
강건성은 테스트 대상 모델을 적대적 훈련(adversarial training)—이미 알려진 왜곡 유형을 사용하여 공격받은 이미지로 모델을 훈련시키는 과정—을 거친 모델과 비교함으로써 벤치마킹됩니다.
강건성 전이성에 관한 주요 연구 결과
OpenAI의 연구에 따르면 적대적 강건성은 서로 다른 왜곡 유형 간에 광범위하게 전이되지 않습니다. 구체적으로:
- 제한된 전이성: 한 가지 왜곡 유형에 대해 적대적 훈련을 통해 얻은 강건성은 반드시 예기치 못한 왜곡에 대해 모델을 보호하지 못합니다.
- Negative Transfer (부정적 전이): 어떤 경우에는 한 가지 왜곡(예: $L_{\infty}$)에 대해 모델을 강화하는 것이 오히려 다른 왜곡(예: $L_{1}$)에 대한 강건성을 감소시킬 수 있습니다. 이는 알려진 공격에 대한 방어를 강화하는 것이 잠재적으로 예기치 못한 공격에 대한 모델의 방어 능력을 해칠 수 있음을 시사합니다.",