OpenAI, 민감한 대화에서 맥락 인식을 개선하기 위해 ChatGPT 안전 업데이트
OpenAI는 ChatGPT에 안전 업데이트를 도입했으며, 이는 미묘하거나 진화하는 신호를 식별함으로써 시간이 지남에 따라 위험이 나타나는 시점을 모델이 인식하도록 설계되었습니다. 이를 통해 ChatGPT는 정상적인 상호작용과 드물게 발생하는 고위험 사례를 더 잘 구분할 수 있게 되며, 모델이 상황을 완화하고, 해로운 세부 정보를 거부하거나, 사용자를 보다 안전한 대안으로 유도하는 등 보다 신중하게 대응할 수 있습니다.
민감한 대화에서 맥락 기반 위험 인식
ChatGPT는 이제 대화의 주변 맥락에서 파생된 잠재적인 해로운 의도를 인식하도록 훈련되었습니다. 이는 개별적으로는 평범하거나 모호해 보이는 요청도 이전의 고통이나 해로운 의도의 징후와 함께 볼 때 다른 의미를 가질 수 있기 때문에 중요합니다.
이번 업데이트의 초점은 자살, 자해 및 타인에게 해를 끼치는 급성 시나리오에 있습니다. 모델 정책과 훈련을 업데이트함으로써 OpenAI는 중요한 상황에서 관련 신호를 연결하도록 모델을 돕고, 일반적인 정상 대화에서는 과잉 반응하지 않도록 목표합니다. 이는 모델이 요청의 위험한 부분을 거부하고, 안전한 경우에는 신중하게 응답하는 “안전한 완성 접근법”을 기반으로 합니다.
대화 간 위험을 위한 안전 요약
별개의 대화에서 발생하는 안전 위험을 해결하기 위해 OpenAI는 “안전 요약”을 개발했습니다. 이는 안전 추론 작업을 위해 훈련된 모델이 만든 이전 안전 관련 맥락에 대한 짧고 사실적인 메모입니다.
안전 요약의 주요 특성은 다음과 같습니다:
- Scope: 좁은 범위로 정의되며 심각한 안전 문제와 관련될 때만 사용됩니다.
- Duration: 제한된 기간 동안 보관됩니다.
- Purpose: 일반적인 개인화나 장기 기억이 아니라 사실적인 안전 맥락을 포착하도록 설계되었습니다.
이러한 요약을 통해 ChatGPT는 단일 대화에서는 정상적으로 보일 수 있는 해로운 의도 패턴을 이전 맥락과 결합해 이해할 때 우려되는 상황을 인식할 수 있습니다.
전문가 협업 및 구현
OpenAI는 법의학 심리학, 자살 예방 및 자해를 전문으로 하는 정신과 의사와 심리학자를 포함한 Global Physicians Network의 의견을 받아 이 시스템을 개발했습니다. 이 전문가들은 다음에 대한 지침을 제공했습니다:
- 언제 안전 요약을 생성해야 하는지.
- 관련으로 판단되어야 할 이전 맥락의 양.
- 모델이 응답 시 해당 맥락을 고려해야 하는 기간.
성능 지표 및 평가
내부 평가는 모델이 모의 고위험 상황에서 의도한 안전한 응답을 제공한 빈도에 초점을 맞추었습니다.
단일 대화 성능
긴 단일 대화 시나리오에서 안전 응답 성능이 다음과 같이 향상되었습니다:
- 50%: 자살 및 자해 사례에서.
- 16%: 타인에게 해를 끼치는 사례에서.
대화 간 성능
GPT-5.5 Instant(현재 ChatGPT의 기본 모델)에서 안전 응답 성능이 다음과 같이 향상되었습니다:
- 52%: 타인에게 해를 끼치는 사례에서.
- 39%: 자살 및 자해 사례에서.
안전 요약 품질
4,000건 이상의 평가에서 안전 요약은 다음 점수를 받았습니다:
- Safety relevance score: 5점 만점에 4.93점.
- Factuality score: 5점 만점에 4.34점.
일반 품질에 미치는 영향
내부 테스트 결과 일상 채팅에서의 응답은 전반적으로 비슷했으며, 안전 요약이 포함된 응답과 포함되지 않은 응답 사이에 의미 있는 사용자 선호도가 없음을 나타냈습니다.
향후 방향
OpenAI는 메시지 전반에 퍼진 미묘한 위험 신호를 식별하는 ChatGPT의 능력을 지속적으로 개선할 계획입니다. 현재 초점은 자해와 타인에게 해를 끼치는 경우이지만, 신중한 보호 조치가 마련된다면 생물학이나 사이버 안전과 같은 다른 고위험 분야에도 유사한 방법을 적용하는 방안을 검토할 수 있습니다.
SUMMARY: OpenAI는 ChatGPT에 안전 업데이트를 적용하여 모델이 단일 및 다중 대화 전반에 걸쳐 진화하는 위험 신호와 해로운 의도를 더 잘 인식하도록 했으며, 특히 자살, 자해 및 타인에게 해를 끼치는 상황에 초점을 맞추었습니다.
TITLE: OpenAI, 민감한 대화에서 맥락 인식을 개선하기 위해 ChatGPT 안전 업데이트