신경망 정책에 대한 적대적 공격
OpenAI 연구원들은 강화 학습(RL)에서 사용되는 신경망 정책이 컴퓨터 비전 분류기에서 이전에 식별된 취약점과 유사하게 적대적 공격에 취약함을 보여주었다. 원시 입력 데이터에 작고 신중하게 설계된 교란을 도입함으로써, 적대자는 인간의 인식을 방해하지 않으면서 훈련된 정책의 테스트 시간 성능을 크게 저하시킬 수 있다.
강화 학습 정책의 취약성
강화 학습에서의 신경망 정책은 모델이 잘못된 결정을 내리도록 강제하기 위해 특별히 구성된 적대적 예시에 취약하다. 이 현상은 이미지 인식용 머신 러닝 분류기에서 잘 문서화되었지만, 이 연구는 동일한 취약점이 RL 에이전트의 의사 결정 정책에도 확장됨을 확인한다.
학습된 작업이나 사용된 특정 훈련 알고리즘에 관계없이, 연구원들은 적대적 교란에 노출될 때 에이전트 성능이 크게 떨어지는 것을 관찰했다. 이는 신경망 정책이 행동을 결정하기 위해 입력 데이터를 처리하는 방식에 체계적인 취약성이 존재함을 나타낸다.
위협 모델 및 공격 방법론
이 연구는 적대자가 정책의 원시 입력에 작은 교란을 도입할 수 있는 위협 모델을 사용한다. 이러한 교란은 인간의 인식을 바꾸지 않을 정도로 최소한으로 설계되었지만, 신경망을 오도하기에 충분하다.
공격 설정
이 연구는 다양한 시나리오에서 취약성의 정도를 특성화했다:
- 화이트박스 설정: 적대자는 정책의 내부 매개변수와 구조에 대한 완전한 지식을 갖는다.
- 블랙박스 설정: 적대자는 정책의 내부 작동에 대한 제한적이거나 전혀 지식이 없다.
두 설정 모두에서 기존의 적대적 예시 생성 기술이 훈련된 정책의 성능을 저하시키는 데 효과적이었다.
AI 안전성에 대한 함의
RL 정책이 인식할 수 없는 입력 변화에 의해 쉽게 방해될 수 있다는 사실은 자율 에이전트의 배포에서 중요한 보안 격차를 시사한다. 이러한 공격이 다양한 작업 및 훈련 알고리즘에서 작동하기 때문에, 이 취약성은 특정 구현의 결함이 아니라 현재 강화 학습에 사용되는 신경망 아키텍처의 근본적인 특성으로 보인다.