OpenAI 커뮤니티 안전 및 폭력 완화 프레임워크
OpenAI 커뮤니티 안전 및 폭력 완화 프레임워크
OpenAI는 모델 훈련, 자동 탐지 시스템, 인간 감독의 조합을 활용하여 서비스가 폭력이나 실제 세계의 피해를 조장하는 데 사용되는 것을 방지합니다. 이 프레임워크는 폭력 행위의 계획 또는 실행에 대한 무관용 정책과 사용자 자유 및 도움이 되는 기능을 균형 있게 유지합니다.
모델 훈련 및 설계를 통한 위험 완화
OpenAI는 폭력을 의미 있게 가능하게 할 수 있는 전술, 계획, 또는 지침에 대한 요청을 거부하도록 모델을 훈련시킵니다. 시스템은 교육적, 역사적, 또는 예방 목적으로 폭력에 관한 무해한 문의와 해로운 요청을 구분하도록 설계되었습니다. 이 완화 전략의 주요 구성 요소는 다음과 같습니다:
- Model Spec 준수: 프레임워크는 합리적인 안전 기본값을 유지하면서 도움이 되는 기능과 사용자 자유를 최대화하는 Model Spec 원칙을 따릅니다.
- 문맥 인식: OpenAI는 장시간 고위험 대화에서 나타나는 미세한 경고 신호를 인식하는 ChatGPT의 능력을 강화했습니다. 개별 메시지는 무해해 보일 수 있지만 더 넓은 패턴은 위험을 시사할 수 있기 때문입니다.
- 위기 지원: 위기에 처했거나 자해 위험이 있는 사용자를 위해 ChatGPT는 해로운 행위를 조장하지 않도록 훈련되었으며, 대신 현지 위기 자원을 제시하고 정신 건강 전문가나 응급 서비스로 안내합니다.
모니터링 및 집행 메커니즘
OpenAI는 위협, 테러, 괴롭힘, 무기 개발과 관련된 정책 위반을 식별하고 조치하기 위해 계층적 탐지 및 검토 프로세스를 사용합니다.
자동 탐지
자동 시스템은 여러 도구를 사용하여 사용자 콘텐츠와 행동을 대규모로 분석합니다:
- 분류기 및 추론 모델.
- 해시 매칭 기술.
- 차단 목록 및 기타 모니터링 시스템.
인간 검토 및 문맥 평가
자동 시스템이 계정 또는 대화를 플래그로 표시하면 훈련된 인원이 문맥 검토를 수행합니다. 이러한 검토자는 엄격한 개인정보 보호 및 보안 safeguard 하에 제한된 사용자 정보에만 접근할 수 있습니다. 목표는 활동이 정책을 위반하거나 실제 세계 폭력의 가능성을 나타내는지 판단하는 것이며, 자동 시스템이 놓칠 수 있는 미묘함과 의도를 고려합니다.
집행 조치
금지 가능한 위반이 확인되면 OpenAI는 즉시 서비스 접근을 차단합니다. 이는 계정 비활성화, 동일한 사용자와 관련된 계정 차단, 새 계정 생성을 방지하기 위한 조치 구현을 포함할 수 있습니다. 사용자는 이러한 집행 결정에 대해 이의를 제기할 권리를 유지합니다.
에스컬레이션 및 실제 세계 개입
대부분의 집행은 OpenAI와 사용자 사이에서 직접 처리되지만, 특정 고위험 시나리오는 외부 에스컬레이션을 촉발합니다.
- 법 집행 알림: 대화가 타인에게 imminently이고 신뢰할 수 있는 피해 위험을 나타낼 때 OpenAI는 법 집행 기관에 알립니다. 이 과정은 구조화된 기준과 정신 건강 및 행동 전문가의 입력을 사용하여 심층 조사를 포함합니다.
- 부모 통제: 부모 계정과 연결된 청소년 계정의 경우, 시스템과 인간 검토자가 급성 고통의 징후를 감지하면 이메일, SMS, 또는 푸시 알림을 통해 부모에게 알릴 수 있습니다.
- 신뢰할 수 있는 연락처 기능: OpenAI는 사용자가 추가 지원이 필요할 수 있을 때 알림을 받을 신뢰할 수 있는 연락처를 지정할 수 있는 기능을 도입하고 있으며, 이는 Global Physicians Network 및 Well-Being and AI 협의회와의 협력을 통해 개발되었습니다.
지속적인 개선 및 안전 진화
OpenAI는 새로운 위험과 전문가 입력을 기반으로 모델, 탐지 방법, 에스컬레이션 기준을 반복적으로 업데이트합니다. 현재 우선순위는 '하드 케이스' 처리를 개선하는 것으로, 이는 보호 장치를 우회하려는 정교한 시도 또는 피해 위험이 즉시 명확하지 않은 모호한 입력을 포함합니다.