OpenAI 아동 안전 및 CSAM 예방 전략
OpenAI 아동 안전 및 CSAM 예방 전략
OpenAI는 AI 모델 및 개발자 생태계 전반에 걸쳐 아동 성학대 자료(CSAM)와 아동 성착취 자료(CSEM)를 방지, 탐지 및 보고하기 위한 다층적 접근 방식을 상세히 설명했습니다.
OpenAI 아동 안전 및 CSAM 예방 전략
OpenAI는 아동 성학대 자료(CSAM)와 아동 성착취 자료(CSEM)의 생성 및 배포를 방지하기 위해 포괄적인 안전 프레임워크를 구현하고 있습니다. 이 전략은 배포 전 교육 보호장치, 실시간 모니터링, 그리고 산업 파트너십을 결합하여 AI를 아동 착취에 사용하는 시도를 차단합니다.
엄격한 금지 및 집행 정책
OpenAI는 18세 미만 개인을 착취, 위험에 빠뜨리거나 성적으로 대상화하는 모든 활동에 대해 자사의 서비스를 사용하는 것을 명시적으로 금지합니다. 이러한 금지는 최종 사용자와 OpenAI 기술을 기반으로 구축하는 개발자 모두에게 적용됩니다.
금지된 활동
- CSAM/CSEM: AI 생성 여부와 관계없이 아동 성학대 자료를 생성하거나 사용하는 행위.
- Grooming and Roleplay: 미성년자를 대상으로 한 유인 행위 또는 미성년자를 포함한 성적/폭력적 역할극에 참여하는 행위.
- Minor Safety: 미성년자에게 그래픽한 자해, 성적 또는 폭력적 콘텐츠를 노출시키는 행위; 비건강한 다이어트나 운동을 조장하는 행위; 그리고 신체 유형이나 외모를 비난하는 행위.
- Dangerous Activities: 미성년자를 위한 위험한 챌린지를 장려하거나 연령 제한이 있는 상품에 대한 접근을 제공하는 행위.
집행 조치
- User Bans: CSAM/CSEM을 업로드하거나 생성하려는 사용자는 즉시 차단되며, National Center for Missing and Exploited Children (NCMEC)에 보고됩니다.
- Developer Accountability: 미성년자를 위한 도구를 구축하는 개발자는 성적으로 노골적이거나 암시적인 콘텐츠 생성 방지를 해야 합니다. OpenAI는 개발자에게 사용자에 의한 CSAM/CSEM 시도 사실을 통보하며, 지속적인 남용 패턴을 해결하지 못할 경우 개발자 차단으로 이어집니다.
- Evasion Monitoring: OpenAI 조사팀은 차단을 회피하기 위해 새 계정을 만드는 사용자를 모니터링합니다.
기술적 보호조치 및 탐지 방법
OpenAI는 모델이 착취 자료를 생성하거나 분석하는 데 사용되지 않도록 다각적인 기술 접근 방식을 적용합니다.
훈련 데이터 무결성
모델이 CSAM 또는 CSEM을 생성할 수 있는 능력을 갖추지 않도록, OpenAI는 훈련 데이터셋에서 해당 자료를 감지하고 제거합니다. 이 과정에서 확인된 CSAM은 NCMEC에 보고됩니다.
실시간 탐지 및 차단
OpenAI는 실서비스에서 남용을 식별하고 차단하기 위해 여러 기술을 활용합니다:
- Hash Matching: 내부 팀이나 Thorn의 검증된 라이브러리를 통해 표시된 알려진 CSAM을 식별하는 데 사용됩니다.
- Content Classifiers: OpenAI는 Thorn의 CSAM 콘텐츠 분류기를 사용하여 제품에 업로드된 잠재적으로 새로운 CSAM을 탐지합니다.
- AI-Driven Monitoring: OpenAI 자체 모델을 배치하여 남용 패턴을 보다 신속하게 탐지합니다.
- Human Review: 분류기가 잠재적 남용을 표시할 경우에만 내부 인간 전문가가 콘텐츠를 검토합니다.
새로운 남용 패턴에 대한 대응
OpenAI는 진화하는 안전 대응이 필요한 특정 남용 패턴을 식별하고 공유했습니다:
- Descriptive Analysis: 일부 사용자는 CSAM을 업로드하고 모델에게 해당 자료에 대한 상세 설명을 생성하도록 요청합니다. OpenAI는 해시 매칭과 Thorn의 분류기를 사용해 이러한 요청을 차단합니다.
- Narrative Integration: 사용자는 CSAM을 서사의 일부로 업로드하여 모델을 허구의 성적 역할극이나 미성년자가 학대 상황에 처한 이야기에 끌어들일 수 있습니다.
이를 방지하기 위해 OpenAI는 프롬프트 수준 탐지와 함께 상황 인식 분류기 및 남용 모니터링을 활용하여 오용에 대한 견고함을 확보합니다.
공공 정책 및 산업 협력
OpenAI는 기술 기업, 법 집행 기관, 그리고 옹호 단체 간의 보다 깊은 협력을 가능하게 하는 공공 정책 프레임워크를 옹호합니다.
레드 팀 챌린지
OpenAI는 미국에서 CSAM 소지가 불법이기 때문에, 시뮬레이션된 자료라도 CSAM을 사용해 AI 모델을 '레드 팀'하는 것이 현재 불법이라고 언급합니다. 이 제한으로 인해 안전 조치를 철저히 검증하기가 어렵습니다.
입법 지원
OpenAI는 뉴욕주에서 제정된 아동 성학대 자료 예방법(Child Sexual Abuse Material Prevention Act)과 같은 입법을 지원합니다. 이 법은 유해한 AI 생성 콘텐츠를 탐지, 분류, 모니터링 및 완화하기 위해 선제적 조치를 취하는 기업에 법적 보호를 제공하는 것을 목표로 합니다.