OpenAI 지시 계층 개선 및 GPT-5 Mini-R
OpenAI는 최첨단 LLM의 지시 계층을 개선하는 방법을 개발하여 모델이 신뢰도가 높은 지시를 신뢰도가 낮은 지시보다 안정적으로 우선시하도록 했습니다. 이 발전은 안전 조정 가능성과 프롬프트 인젝션 공격에 대한 견고성을 향상시키며, 특히 도구 출력에 삽입된 경우에 효과적입니다.
지시 계층 프레임워크
여러 지시 출처 간의 충돌을 해결하기 위해 OpenAI 모델은 정의된 신뢰 계층을 따릅니다: System > Developer > User > Tool.
이 프레임워크에서는 우선순위가 높은 지시가 더 권위 있는 것으로 간주됩니다. 모델은 높은 우선순위 역할이 설정한 제약과 충돌하지 않을 경우에만 낮은 우선순위 지시를 따를 수 있습니다. 예를 들어, 시스템 메시지에 안전 정책이 포함되어 있다면 모델은 해당 정책을 위반하는 사용자 요청을 거부해야 합니다. 마찬가지로, 도구 출력에 악의적인 지시가 포함되어 있다면 모델은 이를 명령으로 실행하는 대신 무시해야 합니다.
지시 계층 훈련에서의 과제
강화 학습(RL)은 이 계층을 가르치는 데 적합한 방법이지만, OpenAI는 순수 RL 적용에서 세 가지 주요 함정을 확인했습니다:
- Instruction-Following Failures: 모델이 계층을 오해해서가 아니라 지시 자체가 너무 복잡해서 충돌을 해결하지 못할 수 있습니다.
- Subjective Conflicts: 지시 충돌은 미묘할 수 있으며, 보상을 할당하기 위해 다른 LLM을 판사로 사용하는 경우 오류가 발생할 수 있습니다.
- Reward Shortcuts: 모델이 보상을 최대화하기 위해 단축 경로를 학습할 수 있는데, 예를 들어 안전을 보장하기 위해 무해한 요청까지도 거부하는 과도한 거부(over-refusal) 현상이 있습니다.
IH-Challenge 접근법
OpenAI는 세 가지 핵심 원칙에 기반한 강화 학습 훈련 데이터셋 IH-Challenge를 설계함으로써 이러한 함정을 해결했습니다:
- Simplicity: 작업은 지시 수행 측면에서 단순하도록 설계되어 계층 문제를 분리합니다.
- Objective Grading: 작업은 간단한 Python 스크립트를 사용해 객관적으로 채점할 수 있어 오류가 발생할 수 있는 LLM 판사의 필요성을 없앱니다.
- No Trivial Shortcuts: 환경이 단순한 단축 경로를 통해 높은 보상을 얻는 것을 방지하도록 구성되었습니다.
각 작업은 높은 권한 역할이 지시를 제공하고(예: "Only answer 'Yes' or 'No'") 낮은 권한 역할이 모델이 해당 지시를 위반하도록 유도하는 대화로 구성됩니다. 모델의 응답은 이후 프로그래밍 방식으로 높은 수준의 제약을 준수하는지 확인됩니다.
GPT-5 Mini-R: 성능 및 견고성
OpenAI는 IH-Challenge를 사용해 GPT-5 Mini-R이라는 내부 모델을 훈련했습니다. 이 모델은 과도한 거부로 붕괴되지 않으면서 여러 벤치마크에서 향상된 성능을 보여줍니다.
학술 벤치마크 결과
| 평가 | GPT-5-Mini | GPT-5 Mini-R | 향상 |
|---|---|---|---|
| Gandalf Password (sys-user) | 0.99 | 0.99 | +0 |
| Gandalf Password (dev-user) | 0.98 | 1.00 | +0.02 |
| TensorTrust (sys-user) | 0.86 | 0.94 | +0.08 |
| TensorTrust (dev-user) | 0.76 | 0.91 | +0.15 |
| RealGuardrails (Distractors) | 0.88 | 0.95 | +0.07 |
| RealGuardrails (Handwritten) | 0.82 | 0.89 | +0.07 |
| System IFEval | 0.92 | 0.96 | +0.04 |
내부 벤치마크 결과
| 평가 | GPT-5-Mini | GPT-5 Mini-R | 향상 |
|---|---|---|---|
| TutorJailbreak (sys-user) | 0.96 | 0.99 | +0.03 |
| Tutor Jailbreak (dev-user) | 0.97 | 0.99 | +0.02 |
| System <> User Conflict | 0.84 | 0.95 | +0.11 |
| System <> Developer Conflict | 0.86 | 0.86 | +0 |
| Developer <> User Conflict | 0.83 | 0.95 | +0.12 |
능력 유지
GPT-5 Mini-R은 최소한의 퇴보로 일반적인 능력을 유지합니다. Chat WinRate가 o1 대비 약간 감소(-0.05)하고 Preference Score도 감소(-0.06)했지만, IH-Challenge 과도한 거부(over-refusal)에서 크게 개선되어 0.79에서 1.00으로 향상되었습니다.
실제 안전 및 보안 함의
지시 계층을 개선하면 두 가지 주요 안전 이점이 있습니다:
안전 조정 가능성
시스템 프롬프트에 카테고리별 안전 사양을 추가함으로써 GPT-5 Mini-R은 OpenAI의 안전 Production Benchmarks에서 허용되지 않은 카테고리 전반에 걸쳐 거부율과 안전한 완료율을 높였습니다. 이 개선은 전체 유용성 비율이 감소하지 않은 상태에서 이루어졌으며, 이는 모델이 단순히 전체 요청을 더 많이 거부하는 것이 아니라, 낮은 우선순위 지시에서 발생하는 위험한 요청을 더 잘 해결한다는 의미입니다.
프롬프트 인젝션 견고성
GPT-5 Mini-R은 도구 출력에 삽입된 악의적인 지시에 대한 저항력이 증가했습니다. 학술 벤치마크 CyberSecEval 2와 OpenAI 내부 프롬프트 인젝션 벤치마크에서의 평가 결과, IH 훈련 모델이 기존 GPT-5 Mini 대비 성능이 크게 향상된 것으로 나타났습니다.
결론 및 데이터셋 공개
AI 시스템이 점점 더 자율적이고 에이전트화됨에 따라, 신뢰할 수 있는 지시를 우선시하는 능력은 중요한 안전 속성이 됩니다. OpenAI는 이 분야의 추가 연구를 지원하기 위해 IH-Challenge dataset을 공개했습니다.