Anthropic 아동 안전 원칙 이니셔티브 발표
TL;DR
Anthropic은 Thorn 및 All Tech Is Human이 주도하는 연합에 참여하여 명시적인 아동 안전 약속을 채택하고, AI 생성 아동 성적 학대물(AIG-CSAM)의 생성 및 유포를 차단하기 위한 구체적인 개발, 배포 및 유지 관리 조치를 개설했습니다.
약속 개요
Anthropic은 자사의 생성형 AI 모델의 수명 주기 전반에 걸쳐 강력한 아동 안전 조치를 구현할 것을 공개적으로 약속했습니다. 이 약속은 AI 시스템이 아동 성적 학대물(CSAM) 및 관련 피해를 생성하거나 유포하는 데 사용될 수 있는 위험을 완화하기 위한 광범위한 업계 노력과 일치합니다.
정책 기반
- Anthropic의 허용 가능한 사용 정책(Acceptable Use Policy)은 아동 성적 착취 또는 학대를 묘사, 권장, 지원 또는 유포하는 모든 콘텐츠를 엄격히 금지합니다.
- 탐지된 위반 사항은 **National Center for Missing & Exploited Children (NCMEC)**에 보고됩니다.
- Anthropic 모델은 이미지를 입력받을 수 있지만, 현재 멀티모달 출력을 생성하지 않으므로, 특정 학대 경로를 제한할 수 있습니다.
Safety-by-Design 원칙
Anthropic은 Thorn이 발표한 Safety by Design 프레임워크를 채택하기로 약속했습니다. 이 프레임워크는 개발(Develop), 배포(Deploy), 유지 관리(Maintain)의 세 단계로 실행 가능한 완화 조치를 정의합니다.
Develop 단계
- 책임 있는 데이터 소싱: 전문가들이 CSAM 또는 아동 성적 착취물(CSEM)을 포함할 가능성이 높은 것으로 식별한 데이터로의 학습을 피합니다.
- 데이터 입력 보호 조치: 학습 데이터에 포함된 CSAM/CSEM이 사용되기 전에 이를 탐지, 제거 및 보고합니다.
- Red-team 테스트: AIG-CSAM 및 CSEM 생성을 목표로 하는 구조화되고 확장 가능한 스트레스 테스트를 수행합니다.
- 정책 정의: 명시적인 학습 데이터 및 모델 개발 정책을 수립합니다.
- 고객 제한: 고객이 아동에 대한 성적 피해를 용이하게 하기 위해 Anthropic 모델을 사용하는 것을 금지합니다.
Deploy 단계
- 콘텐츠 탐지: 입력과 출력 모두에서 학대 콘텐츠(CSAM, AIG-CSAM, CSEM)를 식별합니다.
- 사용자 신고 메커니즘: 사용자가 의심스러운 콘텐츠를 플래그하거나 신고할 수 있는 옵션을 제공합니다.
- 집행: 정책 위반 사항을 집행하기 위한 메커니즘을 구현합니다.
- 예방 메시지: CSAM 요청을 저지하기 위한 경고 및 안내를 배포합니다.
- 단계적 출시: 광범위한 출시 전에 초기 배포 단계에서 학대 사례를 모니터링합니다.
- 모델 카드: 모델 문서에 전용 아동 안전 섹션을 추가합니다.
Maintain 단계
- NCMEC에 보고: 보고서를 제출할 때 Generative AI File Annotation을 사용합니다.
- 지속적인 탐지 및 제거: CSAM, AIG-CSAM, CSEM을 지속적으로 식별, 보고 및 제거합니다.
- 도구 투자: AI 생성 조작으로부터 콘텐츠를 보호하기 위한 도구를 구축합니다.
- 완화 품질: 안전 조치의 효과성을 정기적으로 평가하고 개선합니다.
- 기만 금지: 아동에게 성적 피해를 입히기 위해 생성형 AI를 사용하여 타인을 기만하는 행위를 금지합니다.
- OSINT 모니터링: Anthropic의 플랫폼이 어떻게 악용될 수 있는지 추적하기 위해 오픈 소스 인텔리전스(OSINT)를 활용합니다.
참고 자료
Safety by Design 원칙의 전체 세트와 상세한 완화 전략은 백서 “Safety by Design for Generative AI: Preventing Child Sexual Abuse” (Thorn)에 문서화되어 있습니다. 해당 백서는 다음 링크에서 확인할 수 있습니다: https://info.thorn.org/hubfs/thorn-safety-by-design-for-generative-AI.pdf.
관련 Anthropic 발표
- Improving Fable 5's biology safeguards – Fable 5 모델 시리즈를 위한 추가적인 기술적 보호 조치.
- Mariano-Florentino (Tino) Cuéllar appointed Chief Global Affairs Officer – 글로벌 정책 이니셔티브를 지원하기 위한 리더십 확장.
이러한 관련 게시물은 Anthropic의 AI 제품 포트폴리오 전반에 걸친 안전 및 거버넌스에 대한 Anthropic의 광범위한 관심사를 보여줍니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch