OpenAI 강건한 적대적 입력 연구

OpenAI는 규모나 관점에 관계없이 신경망 분류기를 신뢰할 수 있게 속이는 이미지를 개발했습니다. 이 연구는 적대적 예시가 실제 이미지 캡처에 사용되는 일반적인 변환에 대해 강건하도록 설계될 수 있음을 보여주며, 자율주행차와 같은 시스템이 여러 각도와 규모에서 이미지를 캡처함으로써 본질적으로 보호된다는 주장을 도전합니다.

규모 불변 적대적 예시

강건한 적대적 예시는 분류 전에 입력 이미지를 무작위로 재스케일링하는 확률적 분류기의 앙상블을 최적화하여 생성됩니다. 이 접근법은 투사된 경사 하강법을 사용하여 이미지—예: 고양이 이미지—에 대한 작은 disturbances를 찾아 원하는 다양한 규모에서 동시에 분류기를 속입니다.

변환 불변 적대적 예시

적대적 예시는 학습 perturbations에 무작위 회전, 이동, 스케일, 노이즈 및 평균 이동을 포함시켜 다양한 변환 분포에 대해 불변하게 만들 수 있습니다.

테스트 시 이러한 변환이 무작위로 샘플링될 때, 결과 단일 입력은 이러한 조건 하에서 적대적인 상태를 유지합니다. 이는 적극적인 노력이 물리 세계로 전이되는 적대적 예시를 생성하고, 다양한 관점에서 내재된 이미지 변환에도 불구하고 효과를 유지할 수 있음을 확인합니다.

Sources