GPT-Red: 견고함을 위한 자기 개선의 실현

GPT-Red: 견고함을 위한 자기 개선의 실현

OpenAI는 취약점 발견을 확장하고 모델의 견고함을 개선하기 위해 설계된 자동 레드팀 모델인 GPT-Red를 개발했습니다. GPT-Red를 사용하여 프로덕션 모델을 적대적으로 학습시킴으로써, OpenAI는 최신 릴리스인 GPT-5.6 Sol에서 프롬프트 인젝션에 대한 취약성을 크게 줄였습니다.

GPT-Red를 통한 자동 레드팀

GPT-Red는 정교한 공격자 역할을 하도록 훈련된 내부 전용 모델입니다. 이 모델은 프롬프트를 보내고, 모델의 응답을 관찰하며, 특정 악의적 목표를 달성하기 위해 접근 방식을 반복하며 작동합니다. OpenAI는 GPT-Red를 훈련하는 데 일부 대규모 사후 학습(post-training) 실행과 대등한 규모의 컴퓨팅 자원을 사용하여, 안전성에 특화된 상당한 컴퓨팅 자원 투자를 기록했습니다.

셀프 플레이 강화 학습

GPT-Red는 셀프 플레이 강화 학습 프레임워크를 사용하여 훈련됩니다. 이 설정에서 GPT-Red와 다양한 "방어자" LLM 세트는 다양한 레드팀 시나리오에 걸쳐 동시에 훈련됩니다:

  • 보상: GPT-Red는 성공적인 프롬프트 인젝션과 같이 실패를 성공적으로 유도했을 때 보상을 받습니다. 반대로, 방어 모델은 공격을 저지하고 원래 작업을 완료했을 때 보상을 받습니다.
  • 공진화: 방어 모델이 더 견고해짐에 따라, GPT-Red는 점점 더 강력하고 다양한 공격 벡터를 발견해야만 합니다.
  • 환경 시뮬레이션: 훈련은 프롬프트 인젝션이 로컬 파일, 웹페이지 배너, 이메일 본문 또는 도구 출력에 삽입될 수 있는 현실적인 시나리오에서 발생합니다.

모델 견고성에 미치는 영향: GPT-5.6 Sol

OpenAI는 GPT-Red를 프로덕션 모델의 훈련 프로세스에 직접 통합합니다. 이러한 적대적 학습은 현재까지 프롬프트 인젝션에 대해 가장 견고한 모델인 GPT-5.6 Sol의 견고성을 실질적으로 향상시켰습니다.

주요 견고성 벤치마크

  • 프롬프트 인젝션 감소: GPT-5.6 Sol은 4개월 전의 가장 우수한 프로덕션 모델과 비교했을 때, 가장 어려운 직접 프롬프트 인젝션 벤치마크에서 실패율이 6배 낮습니다.

  • 직접 인젝션 성공률: 광범위한 견고성 환경에서 GPT-5.6 Sol은 GPT-Red의 직접 프롬프트 인젝션 중 단 0.05%에서만 실패합니다.

  • 특정 공격 클래스: GPT-Red의 초기 버전은 "Fake Chain-of-Thought" 공격을 발견했는데, 이는 GPT-5.1에 대해 95%의 성공률을 보였으나 GPT-5.6 Sol에서는 10% 미만으로 감소했습니다.

  • 벤치마크 포화: 브라우징 및 개발자 도구를 대상으로 하는 여러 간접 프롬프트 인젝션 벤치마크는 최신 모델에 의해 포화 상태에 도달하여 97% 이상의 정확도를 달성했습니다.

일반화 및 실제 효과

GPT-Red가 범용 레드팀 에이전트인지 평가하기 위해, OpenAI는 훈련 중에 보지 못한 새로운 환경과 대상 모델에서 그 효과를 테스트했습니다.

인간 레드팀원과의 비교

Dziemian et al. (2025)의 간접 프롬프트 인젝션 아레나를 재현한 버전에서, GPT-Red는 GPT-5.1를 공격하기 위해 인간 레드팀원과 맞붙었습니다. GPT-Red는 84%의 공격 성공률을 달성했으며, 이는 인간이 달성한 13%보다 훨씬 높습니다.

실제 사례 연구

  • AI 자판기 (Vendy): GPT-Red는 자판기를 관리하는 라이브 자율 에이전트를 성공적으로 공격했습니다. 시뮬레이션에서 먼저 반복 학습을 수행한 후 공격을 라이브 에이전트로 전이함으로써, GPT-Red는 세 가지 악의적 목표를 달성했습니다: 고가 품목을 $0.50로 변경, 새로운 고가 품목을 주문하고 $0.50에 제공, 다른 고객의 주문 취소.
  • Codex CLI Agent: 10가지 데이터 유출 시나리오 세트에서, GPT-Red는 프롬프트 기반의 GPT-5.5 베이스라인과 비교했을 때 Codex CLI 에이전트(GPT-5.4 mini 기반)가 민감한 데이터를 유출하도록 강제하는 데 있어 더 효과적이고 토큰 효율적이었습니다.

능력 유지

OpenAI는 견고성 향상이 일반적인 능력의 저하나 과도한 거부(over-refusal)의 증가를 초래하지 않는다고 보고했습니다. 일반적인 프런티어 능력 및 타겟팅된 과도한 거부 작업에 대한 평가 결과, 일반적인 능력은 영향을 받지 않는 것으로 나타났으며, 이는 견고성 이득이 정당한 요청에 대한 기본 거부가 아니라 악의적인 지시에 대한 더 나은 저항력에서 비롯됨을 시사합니다.

Sources