GPT-5 안전 완성: 거부 기반에서 출력 중심 안전 훈련으로의 전환
OpenAI는 GPT-5에 안전 완성(safe-completions)을 도입했으며, 이는 모델이 사용자의 입력을 평가하는 대신 모델 자체 출력의 안전성을 평가하도록 초점을 전환하는 새로운 안전 훈련 방법론입니다. 이 접근 방식은 GPT-5가 "이중 용도" 프롬프트—의도가 명확하지 않아 선의 혹은 악의적인 목적으로 모두 사용될 수 있는 질문—에 대해 안전 경계를 침해하지 않으면서도 유용한 응답을 제공할 수 있게 합니다.
거부 기반 안전 훈련의 한계
전통적인 안전 훈련은 이진적인 결정을 기반으로 합니다: 모델이 프롬프트에 완전히 따르거나 전적으로 거부합니다. 명백히 해로운 요청에 대해서는 효과적이지만, 이 이진 접근 방식은 불꽃놀이를 점화하는 데 필요한 에너지와 같은 이중 용도 프롬프트—학교 프로젝트용일 수도 있고 폭발물 제작용일 수도 있는 요청—에 대해 어려움을 겪습니다.
거부 기반 시스템에서는 모델이 프롬프트가 "너무 해롭다"고 판단해야 합니다. 이는 두 가지 최적이 아닌 결과를 초래합니다:
- 과도한 순응: 모델이 악의적인 사용자에게 위험한 정보를 제공한다.
- 과도한 거부: 모델이 무해한 요청을 거부하여 사용자 경험이 도움이 되지 않는다.
안전 완성: 출력 중심 접근 방식
안전 완성 훈련은 안전 경계를 사용자의 입력에서 모델의 출력으로 이동시킵니다. 프롬프트를 거부할지 여부를 결정하는 대신, 모델은 안전 정책을 위반하지 않는 가장 유용한 응답을 생성하도록 훈련됩니다.
이는 사후 훈련 단계에서 두 가지 주요 훈련 파라미터를 통해 구현됩니다:
- 안전 제약: 보상 시스템은 안전 정책을 위반하는 응답에 대해 페널티를 부과하며, 위반의 심각도에 따라 페널티 강도가 조정됩니다.
- 유용성 극대화: 안전 경계 내에 머무르는 응답에 대해서는 모델이 유용성에 기반해 보상을 받습니다. 이는 사용자의 목표를 직접 달성하거나, 안전하고 유용한 대안을 제시하는 정보성 거부를 제공함으로써 달성됩니다.
GPT-5의 성능 향상
OpenAI는 안전 완성을 GPT-5의 추론 버전과 채팅 버전 모두에 통합했습니다. GPT-5 Thinking (gpt5-r)과 OpenAI o3를 비교했을 때, 안전 완성 훈련은 특히 이중 용도 질문에 대해 안전성과 유용성 모두에서 향상을 보여주었습니다.
OpenAI 실험의 주요 결과는 다음과 같습니다:
- 높은 효용성: GPT-5 Thinking은
o3에 비해 안전한 응답에 대한 안전 점수와 평균 유용성 점수가 더 높았습니다. - 위해 심각도 감소: 모델이 실수로 위험한 출력을 생성할 경우, 그 출력의 심각도는 거부 기반 훈련 모델이 만든 위험한 출력보다 낮습니다.
안전 연구의 진화
안전 완성은 안전과 효용의 균형을 맞추는 OpenAI 접근 방식의 진화를 나타냅니다. GPT-4가 유용성과 안전성 사이의 트레이드오프를 관리하기 위해 규칙 기반 보상(Rule-Based Rewards)을 사용한 반면, GPT-5의 안전 완성은 이 두 목표를 보다 깊게 통합합니다. 프롬프트의 의도보다 응답의 안전성에 초점을 맞춤으로써, OpenAI는 점점 복잡해지는 안전 과제를 보다 섬세하게 다룰 수 있는 기반을 만들고자 합니다.