OpenAI 지시 계층 구조: 특권 지시를 우선시하여 프롬프트 인젝션 방지
OpenAI는 LLM이 특권 지시(예: 시스템 프롬프트)를 신뢰할 수 없는 사용자나 제3자로부터 오는 낮은 우선순위 텍스트보다 우선시하도록 가르치는 지시 계층 구조를 구현함으로써 프롬프트 인젝션 및 탈옥을 완화하는 방법을 개발했습니다. 이 접근 방식은 표준 운영 기능을 유지하면서 적대적 공격에 대한 모델의 견고성을 크게 향상시킵니다.
지시 동등성의 취약점
대형 언어 모델(LLM)은 현재 공격자가 악의적인 프롬프트로 모델의 원래 지시를 덮어쓰는 공격에 취약합니다. 이러한 취약점은 LLM이 일반적으로 시스템 프롬프트(애플리케이션 개발자가 제공)와 신뢰할 수 없는 사용자 또는 제3자 출처가 제공하는 텍스트를 동일한 우선순위로 처리하기 때문에 발생합니다. 모델이 개발자의 지시와 사용자의 요청 사이의 권한을 구분하지 못하면, 개발자의 안전 또는 운영 제약보다 사용자의 악의적인 지시를 따를 수 있습니다.
지시 계층 구조 해결책
상충하는 지시 간의 충돌을 해결하기 위해 OpenAI는 지시 계층 구조를 제안합니다. 이 프레임워크는 서로 다른 우선순위 수준의 지시가 충돌할 때 모델이 어떻게 행동해야 하는지를 명시적으로 정의합니다. 명확한 우선순위 순서를 설정함으로써, 모델은 높은 특권을 가진 지시와 모순될 경우 낮은 특권 출처에서 온 지시를 선택적으로 무시하도록 학습됩니다.
데이터 생성 및 학습
OpenAI는 모델에게 계층적 지시 수행을 가르치기 위해 설계된 특정 데이터 생성 방법을 사용하여 이 계층 구조를 구현했습니다. 이 학습 과정은 모델이 지시의 출처를 인식하고 실행 중에 해당 우선순위 수준을 적용하도록 합니다.
GPT-3.5에 대한 결과 및 영향
GPT-3.5에 적용했을 때, 지시 계층 구조 방법은 다음과 같은 결과를 얻었습니다:
- 견고성 증가: 모델은 프롬프트 인젝션 및 탈옥에 대한 견고성이 크게 향상된 것을 보여주었습니다.
- 일반화: 보호는 학습 단계에서 접하지 못한 공격 유형까지 확장되었습니다.
- 최소한의 성능 트레이드오프: 구현으로 인해 모델의 표준 기능에 최소한의 성능 저하만 발생했습니다.
특권 지시를 우선시함으로써 OpenAI는 일반적인 유용성을 희생하지 않으면서 적대적 조작에 더 강인한 LLM을 향한 길을 제시합니다.