OpenAI, 프롬프트 인젝션에 저항하는 AI 에이전트 설계

OpenAI, 프롬프트 인젝션 방어를 사회공학 모델로 전환

OpenAI는 프롬프트 인젝션으로부터 AI 에이전트를 보호하기 위한 새로운 접근 방식을 발표했으며, 입력 필터링 및 “AI 방화벽”에 의존하던 방식을 버리고 프롬프트 인젝션을 사회공학의 한 형태로 다루는 시스템으로 전환하고 있습니다. 이러한 전환은 현대 공격이 단순한 프롬프트 재정의에서 사회공학과 유사한 복잡한 조작으로 진화했기 때문에 필요하며, 전통적인 분류 시스템으로 감지하기 점점 어려워지고 있기 때문입니다.

프롬프트 인젝션 공격의 진화

프롬프트 인젝션은 외부 콘텐츠에 삽입된 지시가 AI 에이전트를 사용자가 요청하지 않은 행동을 수행하도록 조작하려 할 때 발생합니다. OpenAI는 초기 공격이 위키피디아 페이지에 직접 지시를 추가하는 등 단순했지만, 최신 모델은 이러한 기본 재정의에 대해 더 탄력적으로 대응하고 있음을 관찰했습니다.

그 결과, 공격 기술은 사회공학 전술을 포함하도록 진화했습니다. 이러한 공격이 이제는 허위 정보나 거짓말과 유사해졌기 때문에, “AI 방화벽”이나 입력을 악의적 또는 정상으로 분류하도록 설계된 중간 시스템에 의해 종종 탐지되지 못합니다.

사회공학 위험 관리 프레임워크 적용

이러한 진화하는 위협에 대응하기 위해 OpenAI는 적대적인 환경에서 인간 에이전트에 적용되는 위험 관리 관점으로 AI 에이전트 보안을 다루고 있습니다. 목표는 모든 악의적 입력을 완벽히 식별하려는 시도보다 성공적인 조작의 영향을 제한하는 데 있습니다.

OpenAI는 AI 에이전트를 인간 고객 서비스 담당자에 비유합니다. 이러한 시스템에서 에이전트는 고용주를 대신해 행동해야 하며, 외부 입력에 의해 오도될 수 있습니다. 위험을 완화하기 위해 조직은 다음과 같은 에이전트의 능력을 제한하는 결정론적 시스템과 규칙을 구현합니다:

  • Capability Limitations: 에이전트가 발행할 수 있는 환불 또는 기프트 카드의 금액을 제한합니다.
  • Deterministic Mitigations: 피싱 이메일을 표시하거나 행동에 대한 강력한 제한을 설정하는 시스템을 사용하여 단일 손상된 에이전트가 큰 피해를 일으키는 것을 방지합니다.

ChatGPT에서의 보안 구현

OpenAI는 이 사회공학 프레임워크를 전통적인 보안 엔지니어링, 특히 소스-싱크 분석과 결합합니다. 이 맥락에서 소스는 시스템에 영향을 미치는 방법(신뢰할 수 없는 외부 콘텐츠)이며, 싱크는 잘못된 상황에서 위험해지는 기능(예: 제3자에게 정보 전송)입니다.

위험한 행동이나 민감한 정보의 무음 전송을 방지하기 위해 OpenAI는 ChatGPT에 다음과 같은 방어책을 구현했습니다:

  • Safety Training: 주요 방어책은 안전 교육으로, 대부분의 경우 에이전트가 악의적인 요청을 거부하도록 합니다.
  • Safe Url: 대화 중에 학습된 정보가 제3자에게 전송되려 할 때 이를 감지하도록 설계된 완화 전략입니다. 감지되면 시스템은 전송을 차단하고 에이전트에게 다른 경로를 찾도록 지시하거나, 사용자가 명시적으로 확인하도록 정보를 표시합니다.

AI 에이전트 통합을 위한 권고사항

애플리케이션 시스템에 AI 모델을 통합하는 개발자를 위해 OpenAI는 인간 에이전트가 유사한 역할에서 갖는 제어와 유사한 제어를 구현할 것을 권장합니다. OpenAI는 고도로 지능적인 모델이 결국 인간보다 사회공학에 더 잘 저항할 것으로 기대하지만, 구조적 제어를 구현하는 것이 보안에 가장 비용 효율적이고 실현 가능한 접근법임을 강조합니다.

Sources