gpt-oss-safeguard 릴리즈 노트 / 새로운 기능

OpenAI는 gpt-oss-safeguard의 연구 프리뷰를 출시했는데, 이는 안전 분류를 위해 특별히 설계된 오픈 웨이트 추론 모델 세트입니다. 이러한 모델은 두 가지 크기—gpt-oss-safeguard-120bgpt-oss-safeguard-20b—로 제공되며, 허깅 페이스를 통해 permissive Apache 2.0 라이선스로 배포됩니다.

추론 기반 안전 분류

gpt-oss-safeguard는 라벨이 붙은 예시로부터 결정 경계를 추론하는 분류기 훈련에서 추론 기반 접근 방식으로 안전 분류 패러다임을 전환합니다. 훈련 중에 가중치에 정책을 베이킹하는 대신, 모델은 추론 시 개발자가 제공한 정책을 직접 해석합니다.

주요 기술 기능

  • 동적 정책 적용: 개발자는 정책과 분류할 내용을 동시에 제공할 수 있습니다. 모델은 이 정책을 사용하여 제공된 특정 규칙을 위반하는지 콘텐츠를 판단하며, 이는 진화하는 위험이나 니치 도메인에 대해 매우 유연합니다.
  • 사고 과정 추론: 모델은 해당 결정에 도달하기 위해 사용된 추론과 함께 결론을 출력합니다.これにより 투명성이 제공되고 개발자는 모델이 정책을 어떻게 해석하는지 검토할 수 있습니다.
  • 반복적 정책 개선: 정책이 추론 시 제공되므로, 개발자는 모델을 재훈련하지 않고도 안전 지침을 수정할 수 있습니다.

이상적인 사용 사례

이 추론 기반 접근 방식은 다음과 같은 시나리오에서 특히 효과적입니다:

  • 잠재적인 피해가 빠르게 발생하거나 진화하고 있어 신속한 정책 적응이 필요합니다.
  • 도메인이 altamente 미세하여 작은 전통적인 분류기로 처리하기 어렵습니다.
  • 각 특정 위험에 대해 고품질 분류기를 구축하기에 충분한 훈련 데이터가 없습니다.
  • 낮은 지연 시간보다 설명 가능성과 고품질 라벨이 우선시됩니다.

전통적인 분류기와 비교

OpenAI Moderation API에서 사용되는 것과 같은 전통적인 안전 분류기는 일반적으로 수천 개의 수동으로 큐레이션된 안전한 콘텐츠와 안전하지 않은 콘텐츠 예시로 훈련됩니다. 이러한 전통적인 분류기는 낮은 지연 시간과 낮은 운영 비용을 제공하지만, 개발 및 업데이트에는 상당한 시간과 데이터가 필요합니다.

반면에, gpt-oss-safeguard는 개발자가 사용자 정의 정책을 포함한任何 정책을 적용할 수 있게 하며, 추론을 활용하여 새로운 정책에 걸쳐 일반화함으로써 안전성을 넘어 특정 제품 요구 사항에 대한 일반적인 콘텐츠 라벨링으로 그 유용성을 확장합니다.

내부 구현: Safety Reasoner

gpt-oss-safeguard는 OpenAI가 사용하는 내부 도구인 Safety Reasoner의 오픈 웨이트 구현입니다. 이 도구는 정책 라벨링 작업에 대한 강화 학습 미세 조정을 통해 개발되었으며, 모델이 인간 전문가의 판단을 모방하도록 보상합니다.

OpenAI는 자체 인프라 내에서 Safety Reasoner를 여러 가지 방식으로 활용합니다:

  • 반복적 배포: 새로운 모델은 종종 엄격한 정책과 Safety Reasoner에 대한 높은 컴퓨팅 할당과 함께 배포되어 신중하게 적용되며, 생산 위험이 이해됨에 따라 정책이 조정됩니다.
  • 실시간 차단: 이미지 생성 및 Sora 2의 경우, 실시간으로 안전하지 않은 생성을 차단하기 위해 단계별 평가를 수행합니다.
  • 다층 방어: 생물학 및 자해와 같은 도메인에서는 먼저 빠르고 높은 재현율을 가진 분류기를 사용하여 관심 콘텐츠를 식별한 후, Safety Reasoner가 이를 검토하여 최종 결정을 내립니다.
  • 시스템 통합: GPT-5 및 ChatGPT Agent의 보호 장치의 일부를 형성하며, 상세한 분류에 따라 출력을 분류합니다.

성능 및 벤치마크

OpenAI는 내부 및 외부 데이터 세트에서 gpt-oss-safeguard를 평가했습니다:

  • 다중 정책 정확도: gpt-oss-safeguard 및 내부 Safety Reasoner가 gpt-5-thinking 및 gpt-oss 오픈 모델보다 다중 정책 정확도에서 우수한 성능을 보였습니다.
  • 2022 Moderation 평가 세트: gpt-oss-safeguard가 gpt-5-thinking 및 내부 Safety Reasoner를 포함한 다른 모든 테스트된 모델보다 약간 우수한 성능을 보였습니다.
  • ToxicChat: 이 세트에서 내부 Safety Reasoner 및 gpt-5-thinking이 gpt-oss-safeguard보다 약간 우수한 성능을 보였지만, OpenAI는 gpt-oss-safeguard의 작은 크기가 많은 작업에 더 나은 선택이라고 언급했습니다.

제한 사항

추론 기반 접근 방식에는 두 가지 주요 제한 사항이 있습니다:

  1. 성능 격차: 수만 개의 고품질 라벨이 붙은 샘플로 훈련된 분류기는 여전히 복잡한 위험에 대해 추론 기반 모델보다 우수한 성능을 보일 수 있습니다.
  2. 컴퓨팅 및 지연 시간: 이 프로세스는 전통적인 분류기보다 더 많은 컴퓨팅을 필요로 하고 느립니다. OpenAI는 먼저 작은 분류기를 사용하여 콘텐츠를 필터링하거나 Safety Reasoner를 비동기식으로 실행하여 낮은 지연 시간 사용자 경험을 유지함으로써 이를 내부적으로 관리합니다.

커뮤니티 협력

OpenAI는 Discord, Tomoro, SafetyKit, ROOST의 신뢰 및 안전 전문가와 협력하여 gpt-oss-safeguard를 개발했습니다. 이번 출시를 통해 ROOST는 GitHub에서 **ROOST Model Community (RMC)**를 설립하여 워크플로에 오픈소스 AI 안전 모델을 구현하는 모범 사례를 공유합니다.

Sources