OpenAI 청소년 안전 정책 팩 및 gpt-oss-safeguard

OpenAI는 청소년을 위한 연령에 맞는 보호 장치를 만들고자 하는 개발자를 돕기 위해 프롬프트 기반 안전 정책 세트를 공개했습니다. 이 정책은 gpt-oss-safeguard-20b라는 오픈 가중치 안전 모델과 함께 작동하도록 설계되어, 고수준 안전 요구사항을 실제 AI 시스템에 적용 가능한 분류기로 변환할 수 있게 합니다.

프롬프트 기반 정책을 통한 청소년 안전 운영화

OpenAI는 이러한 안전 정책을 프롬프트 형태로 제공하며, 이를 추론 모델 및 gpt-oss-safeguard 모델과 직접 사용해 일관된 안전 기준을 보장할 수 있습니다. 이 접근 방식은 개발자들이 직면하는 주요 과제인 고수준 안전 목표를 청소년의 고유한 발달 요구와 위험을 고려한 정확하고 실행 가능한 규칙으로 변환하는 문제를 해결합니다.

정책을 프롬프트로 구조화함으로써 개발자는:

  • 기존 워크플로에 안전 검사를 보다 쉽게 통합할 수 있습니다.
  • 특정 사용 사례에 맞게 정책을 조정할 수 있습니다.
  • 시간이 지남에 따라 안전 정의를 반복적으로 개선할 수 있습니다.
  • 실시간 콘텐츠 필터링 및 사용자 생성 콘텐츠의 오프라인 분석 모두에 정책을 활용할 수 있습니다.

초기 안전 정책 릴리스 범위

초기 안전 정책 세트는 청소년이 흔히 겪는 도전에 맞춰 다음 여섯 가지 주요 위험 영역을 다룹니다:

  • 그래픽 폭력 콘텐츠
  • 그래픽 성적 콘텐츠
  • 해로운 신체 이상 및 행동
  • 위험한 활동 및 챌린지
  • 낭만적이거나 폭력적인 역할극
  • 연령 제한이 있는 상품 및 서비스

전문가 협업 및 개발

이 정책들은 Common Sense Mediaeveryone.ai 등 외부 기관의 의견을 반영해 콘텐츠 범위를 정교화하고, 프롬프트 구조를 강화하며, 중요한 엣지 케이스를 식별하는 과정을 거쳤습니다.

이 도구들의 영향에 대해, Common Sense Media의 AI 및 디지털 평가 책임자 Robbie Torney는 다음과 같이 말했습니다:

"청소년을 위한 AI 안전에서 가장 큰 격차 중 하나는 개발자가 구축할 수 있는 명확하고 실행 가능한 정책이 부족하다는 점이었습니다. 많은 경우 개발자는 처음부터 시작해야 했습니다. 이러한 프롬프트 기반 정책은 생태계 전반에 의미 있는 안전 기준을 설정하는 데 도움을 줍니다..."

everyone.AI의 수석 과학자 Dr. Mathilde Cerioli는 이 정책이 "전문가 지식을 실제 시스템에 적용할 수 있는 가이드라인으로 변환하는 데 도움이 된다"고 언급했습니다.

‘깊이 방어(Defense in Depth)’ 전략으로 구현

OpenAI는 이 정책이 완전한 안전 솔루션이라기보다 시작점이라고 강조합니다. 모든 애플리케이션은 고유한 위험과 맥락을 가지고 있기 때문에, 개발자는 다음과 같은 추가적인 보호 조치를 결합한 "깊이 방어" 접근 방식을 채택하도록 권장됩니다:

  • 제품 설계 결정
  • 사용자 제어 옵션
  • 청소년 친화적인 투명성
  • 모니터링 시스템
  • 연령에 맞는 응답

이러한 공개 정책은 OpenAI 내부 경험을 바탕으로 하지만, 회사 내부의 전체 보호 체계를 모두 대변하는 것은 아닙니다.

Sources