OpenAI 악의적 AI 사용 차단 보고서 2025년 6월

OpenAI는 은밀한 영향 작전, 사이버 스파이 활동, 사회공학과 같은 악의적 활동을 탐지하고 차단하기 위해 AI 기반 조사 도구를 활용하고 있습니다. 이 접근 방식은 전문가 팀의 힘 증폭제로 작용하여 남용 활동을 보다 효율적으로 식별하고 공개할 수 있게 합니다.

AI 안전 및 거버넌스를 위한 전략적 프레임워크

OpenAI는 상식적인 규칙과 민주적 AI 개발을 통해 실제 피해로부터 사람들을 보호하는 것을 최우선으로 하는 프레임워크 하에 운영됩니다. 이 전략은 권위주의 정권이 AI 도구를 사용해 권력을 공고히 하거나 시민을 통제하거나 다른 국가를 강제하는 것을 방지하는 데 초점을 맞춥니다.

주요 초점 영역은 다음과 같습니다:

  • 은밀한 영향 작전 (IO)
  • 아동 착취
  • 사기 및 스팸
  • 악의적 사이버 활동

최근 차단 사례 및 사례 연구

2025년 6월 보고서 이전 3개월 동안, OpenAI의 조사 팀은 AI를 활용해 여러 유형의 남용 활동을 탐지하고 공개했습니다. 방어 메커니즘에 AI를 통합함으로써 조직은 다음과 같은 활동을 성공적으로 차단했습니다:

  • 은밀한 영향 작전: 여론을 조작하기 위해 설계된 기만적인 캠페인을 식별합니다.
  • 사이버 스파이 활동: 무단 데이터 접근이나 정보 수집을 위해 AI를 사용하려는 시도를 탐지합니다.
  • 사회공학: 사용자를 속이기 위해 심리적 조작에 의존하는 공격을 방지합니다.
  • 기만적인 고용 사기: 사기나 데이터 절도를 위한 수단으로 사용되는 허위 채용 제안을 공개합니다.
  • 일반 사기: 다양한 AI 기반 사기 활동을 차단합니다.

미국 AI 행동 계획과의 정렬

이러한 노력은 OpenAI가 3월에 과학기술정책실(OSTP)에 제출한 미국 AI 행동 계획과 일치합니다. 조직은 AI가 인류에 혜택을 주기 위해서는 두 가지 접근이 필요하다고 주장합니다: 해를 방지하는 규칙을 시행하고, 체계적인 남용에 맞서는 방어자를 지원하기 위해 AI 도구를 배포하는 것입니다.

Sources