OpenAI 안전 버그 현상금 프로그램 시작

OpenAI는 자사 제품 전반에 걸친 AI 남용 및 안전 위험을 식별하고 완화하기 위해 공개 안전 버그 현상금 프로그램을 시작했습니다. 이 프로그램은 기존 보안 버그 현상금 프로그램을 보완하도록 설계되었으며, 전통적인 보안 취약점에 해당하지 않더라도 의미 있는 안전 위험을 초래하는 문제를 발견한 연구자에게 보상을 제공합니다.

에이전시 위험 및 MCP

OpenAI는 모델 컨텍스트 프로토콜(MCP)을 포함한 에이전시 AI 제품과 관련된 위험 식별을 최우선으로 하고 있습니다. 프로그램은 다음과 같은 에이전시 취약점에 대한 보고를 받습니다:

  • 제3자 프롬프트 인젝션 및 데이터 유출: 보고서는 공격자 텍스트가 피해자의 에이전트(예: ChatGPT Agent 또는 Browser)를 신뢰성 있게 탈취하여 해로운 행동을 수행하거나 민감한 사용자 정보를 유출할 수 있음을 입증해야 합니다. 이러한 행동은 최소 50% 이상의 재현성을 가져야 합니다.
  • 대규모 무단 행동: 에이전시 OpenAI 제품이 OpenAI 자체 웹사이트에서 대규모로 허용되지 않은 행동을 수행하는 경우.
  • 일반적인 해로운 행동: 다른 카테고리에 명시되지 않더라도 실질적이고 중대한 피해를 초래할 수 있는 모든 에이전시 행동.

MCP 위험을 테스트하는 연구자는 제3자 서비스 약관을 준수해야 합니다.

OpenAI 독점 정보

이 프로그램은 OpenAI 내부 데이터의 노출을 목표로 합니다. 적용 범위에 포함되는 문제는 다음과 같습니다:

  • 추론 관련 독점 정보: 모델의 추론 과정에 관한 독점 정보를 반환하는 모델 생성 결과.
  • 일반적인 독점 정보 유출: 기타 OpenAI 독점 정보를 노출하는 취약점.

계정 및 플랫폼 무결성

이 프로그램은 시스템 접근 제어와 신뢰 신호의 무결성을 유지하는 데 중점을 둡니다:

  • 무결성 신호 우회: 사용자가 자동화 방지 제어를 우회하거나 계정 신뢰 신호를 조작하거나 계정 제한, 정지, 차단을 회피할 수 있게 하는 취약점.
  • 권한 기반 문제: 기능, 데이터 또는 기능에 대한 무단 접근을 허용하는 문제는 보안 버그 현상금 프로그램으로 전환됩니다.

범위 제한 및 제외 항목

OpenAI는 일반적인 탈옥 및 콘텐츠 정책 우회가 이 프로그램의 범위에 포함되지 않음을 명시합니다. 특히, 모델이 무례한 언어를 사용하거나 검색 엔진을 통해 쉽게 찾을 수 있는 정보를 반환하는 “탈옥”은 보상 대상이 아닙니다.

하지만 OpenAI는 실질적인 사용자 피해로 이어지는 직접적인 경로를 제공하고 실행 가능한 해결 방안을 제시하는 결함에 대해서는 사례별로 보상을 검토할 수 있습니다. 또한, 연구소는 ChatGPT Agent와 GPT-5에서의 바이오리스크 콘텐츠 문제와 같이 특정 위험 유형에 대해 정기적으로 비공개 캠페인을 진행합니다.

참여 절차

연구자는 Bugcrowd 플랫폼을 통해 프로그램에 참여 신청을 할 수 있습니다. 제출물은 OpenAI의 안전 및 보안 버그 현상금 팀에 의해 분류되며, 문제의 범위와 소유권에 따라 두 프로그램 간에 보고서가 전환될 수 있습니다.

Sources