OpenAI 정신 건강 및 위기 개입 보호 조치

OpenAI는 사용자가 정신적·감정적 고통을 겪을 때 이를 인식하고 대응하기 위한 다층적인 보호 시스템을 구현하고 있으며, 취약한 개인을 전문적인 치료와 연결하는 것을 목표로 합니다. 이 노력에는 GPT‑5의 배포가 포함되며, GPT‑4o에 비해 정신 건강 비상 상황에서 비이상적인 응답을 25% 이상 감소시킵니다.

정신 건강 및 위기 대응을 위한 현재 보호 조치

ChatGPT는 사용자가 취약성을 표현하거나 자신이나 타인에게 해를 가하려는 의도를 보일 때 위험을 식별하고 완화하기 위해 다층 접근 방식을 사용합니다.

인식 및 공감적 응답

2023년 초부터 OpenAI 모델은 자해 지시를 제공하지 않도록 훈련되었으며, 대신 지원적이고 공감적인 언어를 사용합니다. 사용자가 자해 의사를 표현하면 모델은 그 감정을 인정하고 전문적인 도움으로 사용자를 안내하도록 훈련됩니다.

이를 지원하기 위해 OpenAI는 "defense in depth" 접근 방식을 사용하여 분류기가 안전 훈련을 위반하는 응답을 자동으로 차단합니다. 이러한 보호는 로그아웃 상태 사용자와 미성년자에게 강화됩니다. 또한, 자해를 포함한 이미지 출력은 모든 사용자에게 차단되며, 미성년자에 대해서는 더욱 엄격한 보호가 적용됩니다. 위기 상황에서 과도한 사용을 방지하기 위해 ChatGPT는 매우 긴 세션 중에 사용자가 휴식을 취하도록 유도합니다.

실제 자원 안내

자살 의도가 감지되면 ChatGPT는 사용자를 전문적인 도움으로 안내하도록 프로그래밍되어 있습니다. 구체적인 안내는 다음과 같습니다:

  • 미국: 988 (자살 및 위기 핫라인)
  • 영국: Samaritans
  • 전 세계: findahelpline.com

이러한 행동은 30개국 이상에서 활동하는 90명 이상의 의사(정신과 의사, 소아과 의사, 일반 개업의)와 정신 건강, 청소년 발달, 인간‑컴퓨터 상호작용을 전문으로 하는 자문 그룹과 협력하여 개발되었습니다.

타인에 대한 물리적 해악 에스컬레이션

OpenAI는 사용자가 타인에게 해를 가하려는 계획을 논의하는 대화를 위한 특수 파이프라인을 유지합니다. 이러한 대화는 계정을 차단할 권한이 있는 훈련된 팀에 의해 검토됩니다. 인간 검토자가 타인에 대한 중대한 물리적 위협이 임박했다고 판단하면 해당 사례는 법 집행 기관에 회부될 수 있습니다.

특히, OpenAI는 자해 사례를 법 집행 기관에 회부하지 않아 상호작용의 프라이버시를 보호합니다.

GPT‑5 기술 개선 사항

2023년 8월에 출시된 GPT‑5는 현재 ChatGPT의 기본 모델이며, 여러 안전‑특화 향상을 도입했습니다:

  • 오류율 감소: GPT‑5는 정신 건강 비상 상황에서 비이상적인 응답의 발생률을 GPT‑4o에 비해 25% 이상 감소시킵니다.
  • 행동 정제: 모델은 아첨(시코피) 경향을 줄이고, 감정적 의존 수준이 비정상적으로 높아지는 것을 방지하는 데 개선되었습니다.
  • 안전한 완성(Safe Completions): GPT‑5는 "safe completions"이라는 새로운 훈련 방식을 활용하여, 상세한 답변이 안전하지 않을 경우 부분적이거나 고수준의 답변을 제공함으로써 모델이 유용성을 유지하면서 안전 경계를 넘지 않도록 합니다.

확인된 시스템 제한 사항 및 완화 방안

OpenAI는 보호 조치가 약화될 수 있는 특정 실패 모드를 확인했으며, 다음과 같은 작업을 진행 중입니다:

  • 긴 대화 악화: 대화 길이가 증가함에 따라 안전 훈련이 덜 신뢰될 수 있습니다. 예를 들어, 모델이 초기에는 사용자를 핫라인으로 안내하지만 장시간 교류 후에는 이를 놓칠 수 있습니다. OpenAI는 여러 개별 대화에 걸쳐 일관된 행동을 보장하는 방법을 연구하고 있습니다.
  • 분류기 임계값: 차단되어야 할 일부 콘텐츠가 분류기가 입력의 심각성을 과소평가해 놓치는 경우가 있습니다. OpenAI는 이러한 임계값을 조정하여 보호가 보다 신뢰성 있게 작동하도록 하고 있습니다.

위기 개입을 위한 향후 로드맵

OpenAI는 급성 자해를 넘어 보다 광범위한 정신적 고통과 직접적인 개입으로 역량을 확장하고 있습니다:

확대된 위기 인식

OpenAI는 GPT‑5 업데이트를 개발 중이며, 수면 부족으로 인한 무적감과 같은 비급성 고통을 더 잘 인식하도록 하고 있습니다. 목표는 사용자를 현실에 기반하게 하고 휴식을 권장함으로써 상황을 완화하는 것입니다.

직접적인 응급 및 전문 접근

OpenAI는 링크 제공에서 직접 접근 제공으로 전환할 계획입니다:

  • 원클릭 접근: 응급 서비스에 원클릭으로 접근할 수 있도록 구현합니다.
  • 전문 네트워크: 사용자가 급성 위기에 도달하기 전에 ChatGPT를 통해 직접 연락할 수 있는 면허 있는 전문가와 인증된 치료사 네트워크 구축을 탐색합니다.

신뢰할 수 있는 연락처 통합

OpenAI는 사용자가 개인 지원 시스템에 쉽게 연결될 수 있도록 기능을 탐색하고 있습니다:

  • 저장된 응급 연락처, 친구, 가족에게 원클릭 메시지 또는 전화 걸기.
  • 사용자가 심각한 상황에 처했을 때 지정된 사람에게 ChatGPT가 대신 연락하도록 하는 옵트인 기능.

청소년을 위한 강화된 보호

OpenAI는 18세 미만 사용자를 위한 특수 보호 조치를 도입합니다:

  • 부모 통제: 부모가 자녀의 ChatGPT 사용을 파악하고 형태를 조정할 수 있는 도구.
  • 청소년 응급 연락처: 부모 감독 하에 청소년이 급성 고통 시 직접 연결할 수 있는 신뢰할 수 있는 응급 연락처를 지정하도록 허용합니다.

Sources