liu00222/Open-Prompt-Injection

This repository provides a benchmark for prompt injection attacks and defenses in LLMs

해결하는 문제

대규모 언어 모델(LLM) 통합 애플리케이션 및 에이전트에서 프롬프트 인젝션 공격 및 방어를 구현하고 평가하며 확장하기 위한 표준화된 툴킷을 제공하여, 연구자와 개발자가 이러한 취약점이 모델의 행동에 미치는 영향을 벤치마킹할 수 있도록 지원합니다.

작동 방식

이 툴킷은 팩토리 기반 접근 방식을 사용하여 모델, 작업, 공격자를 생성합니다. 사용자는 타겟 작업(예: 감성 분석)과 인젝션 작업(예: 스팸 탐지)을 정의하여 공격을 시뮬레이션할 수 있습니다. 방어 기능으로는 DataSentinel(프롬프트가 오염되었는지 감지)과 PromptLocate(인젝션된 부분을 국지화하여 원본 데이터를 복구)와 같은 전용 구성 요소가 포함되어 있습니다.

대상 사용자

AI 에이전트 및 애플리케이션의 프롬프트 인젝션 공격에 대한 강건성을 테스트하고자 하는 보안 연구자, AI 개발자, LLM 전문가.

주요 특징

  • 공격 시뮬레이션: 공격 성공률(ASV)을 평가하기 위한 복합 공격 전략을 지원합니다.
  • 검출 파이프라인: 게임 이론 기반의 프롬프트 인젝션 검출을 위한 DataSentinel을 제공합니다.
  • 국지화: 인젝션된 프롬프트를 식별하고 분리하여 데이터 복구를 가능하게 하는 PromptLocate를 포함합니다.
  • 확장 가능한 프레임워크: 설정 파일을 사용해 모델(PaLM2, Llama, GPT 등)과 작업을 쉽게 교체할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트