OpenAI 프롬프트 인젝션 보안 개요

프롬프트 인젝션은 대화형 AI를 대상으로 하는 사회 공학 공격입니다

프롬프트 인젝션은 사용자도 AI도 아닌 제3자가 대화의 맥락에 악성 지시를 삽입하여 모델을 오도할 때 발생합니다. 이는 AI가 웹 페이지, 문서, 이메일과 같은 외부 콘텐츠에 접근할 때 자주 발생하며, 이러한 콘텐츠에는 AI를 속여 의도하지 않은 행동을 수행하도록 설계된 숨겨진 지시가 포함될 수 있습니다.

AI 도구가 단순한 질문-답변 시스템에서 웹을 탐색하고 여행을 계획하며 앱 데이터에 접근할 수 있는 에이전트로 전환됨에 따라 이러한 공격의 위험이 증가합니다. 가능한 결과는 다음과 같습니다:

  • 비최적 권장사항: 공격자는 목록에 악성 지시를 숨겨 사용자 선호도와 관계없이 특정 부동산을 추천하도록 AI를 강제할 수 있습니다.
  • 데이터 유출: 공격자는 오해의 소지가 있는 정보를 포함한 이메일을 보내 AI 에이전트를 속여 사용자의 은행 명세서를 찾고 공유하도록 할 수 있습니다.

OpenAI의 다층 방어 전략

OpenAI는 프롬프트 인젝션 위험을 완화하고 모델의 견고성을 높이기 위해 여러 겹치는 기술적 및 절차적 보호 조치를 사용합니다.

안전 교육 및 연구

OpenAI는 안전 교육을 사용하여 모델이 프롬프트 인젝션 패턴을 인식하고 무시하도록 돕습니다. 여기에는 Instruction Hierarchy 개발이 포함되며, 신뢰할 수 있는 지시와 신뢰할 수 없는 지시를 구분하도록 모델을 돕는 연구가 포함됩니다. 회사는 또한 자동화된 레드팀을 활용하여 새로운 공격 벡터를 발견하고 개발하여 사전 예방적 완화를 수행합니다.

자동 모니터링

AI 기반 모니터가 실시간으로 프롬프트 인젝션 공격을 식별하고 차단하기 위해 배포됩니다. 이러한 모니터는 새로운 공격 패턴에 대한 신속한 업데이트를 허용하여 안전 교육을 보완하고, 공격이广泛 배포되기 전에 OpenAI가 적대적 연구 및 테스트를 감지하도록 돕습니다.

인프라 및 보안 보호

제품별 보안 조치가 사용자 데이터를 보호하기 위해 구현됩니다:

  • 링크 승인: ChatGPT는 사용자가 특정 링크를 방문하기 전에 승인을 요구할 수 있으며, 특히 색인 생성을 요청하지 않은 웹사이트의 경우 그렇습니다.
  • 샌드박싱: 코드 또는 프로그램을 실행하는 도구(예: Codex 또는 Canvas)의 경우, 샌드박싱을 사용하여 주입으로 인한 해로운 변경이 모델에 의해 이루어지는 것을 방지합니다.

사용자 통제 및 투명성

OpenAI는 사용자가 자신의 위험을 관리할 수 있는 통제 기능을 통합합니다:

  • 로그아웃 모드: ChatGPT Atlas에서 사용자는 사이트에 로그인하지 않고 작업을 시작할 수 있습니다.
  • 확인 프롬프트: 에이전트는 구매를 완료하는 것과 같은 민감한 작업을 수행하기 전에 일시停止하고 확인을 요구합니다.
  • 워치 모드: 민감한 사이트의 경우, 이 모드는 사용자에게 경고하고 브라우저 탭이 활성 상태를 유지하도록 요구합니다; 사용자가 이동하면 에이전트가 일시停止됩니다.
  • 교육: OpenAI는 ChatGPT를 다른 앱과 연결할 때 어떤 데이터에 접근하는지와 관련된 위험에 대한 설명을 제공합니다.

외부 검증

OpenAI는 프롬프트 인젝션에 중점을 둔 수천 시간의 내부 및 외부 레드팀과 버그 보상 프로그램을 활용하여 의도치 않은 데이터 노출로 이어지는 현실적인 공격 경로를 보여주는 독립 보안 연구자에게 보상을 제공합니다.

AI 에이전트 보안을 위한 사용자 모범 사례

프롬프트 인젝션의 위험을 줄이기 위해 OpenAI는 다음과 같은 행동적 보호 조치를 권장합니다:

  • 데이터 접근 제한: '로그아웃' 모드와 같은 기능을 사용하여 에이전트의 접근을 작업에 필요한 자격 증명 또는 민감한 데이터만으로 제한합니다.
  • 결과가 있는 작업 확인: 에이전트가 이메일을 보내거나 구매를 완료하도록 허용하기 전에 확인 프롬프트를 주의 깊게 검토합니다.
  • 활성 모니터링: 에이전트가 민감한 사이트(예: 은행)에서 작동할 때, 사용자는 에이전트의 작업을 적극적으로 관찰해야 합니다.
  • 명시적 지시 제공: '내 이메일을 검토하고 필요한 조치를 취하라'와 같은 광범위한 명령을 피하고 대신 구체적이고 좁은 지시를 제공하여 악성 콘텐츠가 모델을 오도하기 어렵게 만듭니다.

AI 보안의 미래 전망

OpenAI는 프롬프트 인젝션을 지속적인 위험 완화 전략의 발전이 필요한 frontier 연구 문제로 설명합니다. 아직 공격자들이 이러한 기술을 크게 채택하지는 않았지만, OpenAI는 AI 견고성을 향상시키기 위한 연구에 투자하고 있으며, AI가 인터넷과 통신할 때 대화 정보를 전송하는 시점을 탐지하는 forthcoming 보고서를 발표할 계획입니다.

Sources