OpenAI가 민감한 대화를 위한 ChatGPT 응답을 강화합니다

OpenAI가 ChatGPT의 기본 모델을 업데이트하여 고통스러운 순간에 사용자를 인식하고 지원하는 능력을 향상시켰습니다. 정신 건강 전문가와의 협업을 통해, 연구소는 모델을 훈련시켜 고통을 더 잘 인식하고, 대화를 완화하며, 사용자를 전문적인 치료로 안내함으로써, 정신 건강 관련 영역에서 원하는 안전 행동을 따르지 않는 응답이 65%에서 80% 감소하는 결과를 가져왔습니다.

핵심 안전 집중 영역

OpenAI는 이러한 안전 개선을 위한 세 가지 우선 영역을 식별했으며, 이는 이제 모든 미래 모델 릴리스에 대한 표준 기본 안전 테스트에 통합되었습니다:

  1. 정신 건강 문제: 정신병 또는 조증과 같은 심각한 증상 해결.
  2. 자해 및 자살: 자살 및 자해 생각 감지 및 대응.
  3. AI에 대한 감정적 의존: 사용자가 실제 세계 관계와 복지를 희생하면서 모델에 대한 독점적인 애착을 보이는 패턴 관리.

기술적 구현 및 방법론

이러한 영역에서 응답을 개선하기 위해 OpenAI는 다섯 단계 반복 과정을 사용합니다:

  • 문제 정의: 잠재적인 피해 유형 매핑.
  • 측정: 평가, 실제 대화 데이터, 사용자 연구를 사용하여 위험 식별.
  • 검증: 외부 정신 건강 및 안전 전문가와 정의 및 정책 검토.
  • 완화: 모델 사후 훈련 및 제품 개입 업데이트.
  • 반복: 완화 조치 검증 및 성능 지속 측정.

이 과정의 일부로, OpenAI는 "택소노미"—민감한 대화를 위한 이상적 및 원하지 않는 모델 행동을 정의하는 상세한 가이드를 개발합니다. 이러한 택소노미는 모델을 가르치고 배포 전후의 성능을 추적하는 데 사용됩니다.

성능 지표 및 결과

OpenAI는 프로덕션 트래픽 측정과 '오프라인 평가'—고위험 시나리오에 초점을 맞추어 모델이 가장 likely to fail할 가능성이 높은 상황을 대상으로 설계된 구조화된 적대적 테스트를 모두 활용합니다.

정신병, 조증 및 심각한 정신 건강 증상

  • 프로덕션 영향: 최신 GPT-5 업데이트로 프로덕션 트래픽에서 비준수 응답이 65% 감소했습니다.
  • 유병률: 약 0.07%의 주간 활성 사용자와 0.01%의 메시지에서 정신병 또는 조증 징후가 나타납니다.
  • 비교 성능: 전문가들은 새로운 GPT-5 모델이 GPT-4o 대비 원하지 않는 응답을 39% 감소시켰다고 밝혔습니다 (n=677).
  • 자동 평가: 새로운 GPT-5 모델은 92%의 준수 점수를 받았으며, 이전 GPT-5 버전은 27%였습니다.

자해 및 자살

  • 프로덕션 영향: 비준수 응답 비율이 약 65% 감소한 것으로 추정됩니다.
  • 유병률: 약 0.15%의 주간 활성 사용자와 0.05%의 메시지에서 자살 생각 또는 의도 지표가 포함됩니다.
  • 비교 성능: 전문가들은 GPT-5가 GPT-4o 대비 원하지 않는 답변을 52% 감소시켰다고 밝혔습니다 (n=630).
  • 자동 평가: 새로운 GPT-5 모델은 91%의 준수 점수를 받았으며, 이전 GPT-5 버전은 77%였습니다.
  • 장대화 신뢰도: 모델은 어려운 장대화에서 95% 이상의 신뢰도를 유지했으며, gpt-5-oct-3는 확장된 상호 작용에서 특히 더 안전하고 안정적이라고 명시되었습니다.

AI에 대한 감정적 의존

  • 프로덕션 영향: 최신 업데이트로 프로덕션 트래픽에서 비준수 응답이 약 80% 감소했습니다.
  • 유병률: 약 0.15%의 주간 활성 사용자와 0.03%의 메시지에서 감정적 애착이 heightened됨을 나타냅니다.
  • 비교 성능: 전문가들은 GPT-5가 GPT-4o 대비 원하지 않는 답변을 42% 감소시켰다고 밝혔습니다 (n=507).
  • 자동 평가: 새로운 GPT-5 모델은 97%의 준수 점수를 받았으며, 이전 GPT-5 버전은 50%였습니다.

전문가 협업 및 검증

OpenAI는 60개국에 걸쳐 거의 300명의 의사 및 심리사로 구성된 Global Physician Network와 협력했습니다. 이 임상의 중 170명 이상이 이상적인 응답 작성, 모델 안전도 평가, 임상 지침 제공을 통해 기여했습니다. 정신과 의사 및 심리사가 1,800개 이상의 모델 응답을 검토했습니다. 그들의 결과는 새로운 GPT-5 모델과 GPT-4o를 비교했을 때 원하지 않는 응답이 39-52% 감소했다는 것을 확인했습니다. 이들 전문가 간의 평가자 간 동의율은 71%에서 77% 사이로, 임상 판단의 inherent complexity와 전문적 차이를 반영합니다.

Model Spec 업데이트

이 업데이트는 Model Spec에 기반하며, 이제 Model Spec이 모델이 다음과 같아야 한다고 명시적으로述べ고 있습니다:

  • 사용자의 실제 세계 관계를 지원하고 존중합니다.
  • 정신 또는 정서적 고통과 관련된 근거 없는 믿음을 affirm하지 않습니다.
  • 망상 또는 조증의 징후에 안전하고 공감적으로 대응합니다.
  • 자해 또는 자살 위험의 간접적인 신호에 더 가까운 주의를 기울입니다.

Sources