OpenAI 연구: 섭동 유형 간 적대적 강건성 전이
OpenAI 연구원들은 심층 신경망의 적대적 강건성이 서로 다른 유형의 섭동 사이에서 자동으로 전이되지 않는다는 것을 입증했습니다. 이 발견은 특정 유형의 공격에 저항하도록 훈련된 모델이 다른 공격에는 여전히 취약할 수 있거나, 어떤 경우에는 훈련의 결과로 다른 섭동 유형에 더 취약해질 수도 있음을 나타냅니다.
섭동 유형에 따른 불일치하는 강건성 전이
적대적 강건성은 한 섭동 유형에서 다른 유형으로 안정적으로 전이되지 않습니다. 적대적 예시에 대한 기존 연구의 상당 부분이 $L_{\infty}$ 및 $L_{2}$-제한된 섭동에 집중되어 왔지만, 이는 공격자가 사용할 수 있는 공격의 전체 범위를 포괄하지 않습니다.
이를 테스트하기 위해, OpenAI는 ImageNet의 100개 클래스 하위 집합에 대해 적대적으로 훈련된 모델을 대상으로 5가지의 서로 다른 섭동 유형에 걸쳐 32가지의 서로 다른 공격을 평가했습니다. 실증적 결과는 특정 섭동 유형에 대한 강건성이 다른 유형에 대한 강건성을 보장하지 않는다는 것을 나타냅니다.
평가에서의 섭동 크기의 역할
섭동 유형 간에 강건성이 전이되는지 이해하려면 광범위한 범위의 섭동 크기에 걸쳐 모델을 평가해야 합니다. 연구원들은 평가를 좁은 범위의 크기로 제한하는 것이 모델의 실제 회복력에 대한 불완전하거나 오해의 소지가 있는 이해를 초래할 수 있다는 것을 발견했습니다.
적대적 방어의 잠재적 트레이드오프
한 유형의 섭동에 대해 강건하도록 모델을 훈련하는 것은 다른 유형에 대한 보호를 제공하지 못할 뿐만 아니라, 때로는 그들에 대한 강건성을 능동적으로 저하시킬 수도 있습니다. 이는 한 공격 벡터에 대해 방어하는 것이 의도치 않게 다른 섭동 유형에 대한 새로운 취약점을 만들 수 있는 잠재적 트레이드오프가 존재함을 시사합니다.
AI 안전성 평가를 위한 권장 사항
강건성이 보편적으로 전이되지 않기 때문에, OpenAI는 적대적 방어의 평가가 다양한 범위의 섭동 유형과 크기에 대해 수행될 것을 권장합니다. 단일일 지표표나 작은 범위의 제한된 섭동(예: $L_{\infty}$ 또는 $L_{2}$)에 의존하는 것은 실제 세계의 적대적 위협에 대해 심층 신경망의 보안과 신뢰성을 검증하는 데 불충분합니다.