OpenAI gpt-oss-safeguard 기술 보고서

OpenAI는 gpt-oss-safeguard-120b와 gpt-oss-safeguard-20b를 출시했습니다. 제공된 정책에 따라 콘텐츠를 분류하도록 설계된 오픈 웨이트 추론 모델입니다. 이러한 모델은 gpt-oss 계열에서 후 훈련되었으며 Apache 2.0 라이선스로 제공됩니다.

모델 버전 및 라이선스

gpt-oss-safeguard 모델은 두 가지 크기(120b와 20b)로 제공됩니다. 이러한 모델은 텍스트 전용이며 Responses API와 호환됩니다. Apache 2.0 라이선스 및 OpenAI의 gpt-oss 사용 정책에 따라 출시되었습니다.

기술 기능 및 커스터마이징

이 모델들은 정책 기반 콘텐츠 분류를 위해 설계되었습니다. 제공된 정책을 통해 추론하여 콘텐츠가 해당 레이블로 지정되어야 하는지 판단하도록 최적화되었습니다. 주요 기술 기능은 다음과 같습니다:

  • Chain-of-Thought (CoT): 모델은 전체 체인오브思考(CoT) 추론을 제공하여 사용자가 분류 결정을 내리는 데 사용된 내부 논리를 볼 수 있도록 합니다.
  • Reasoning Effort Levels: 사용자는 성능과 지연 시간을 균형 있게 맞추기 위해 모델에 다양한 추론 노력 수준(낮음, 중간, 높음)을 설정할 수 있습니다.
  • Structured Outputs: 모델은 Structured Outputs를 지원하여 분류 레이블이 예측 가능하고 기계가 읽을 수 있는 형식으로 반환되도록 보장합니다.

의도된 사용 및 응용

OpenAI는 gpt-oss-safeguard 모델을 애플리케이션의 핵심 사용자 대면 기능이 아닌 분류 레이어로 사용할 것을 권장합니다. 범용 상호작용의 경우 원래의 gpt-oss 모델이 더 적합합니다.

안전 및 위험 평가

이 모델들이 오픈 웨이트이기 때문에, OpenAI는 채팅 환경에서 사용되더라도 안전 기준을 충족하도록 안전 평가를 수행했습니다. 이는 그들의 의도된 주요 사용 사례가 아니더라도 말입니다.

프론티어 위험에 관해서, OpenAI는 추가적인 생물학적 또는 사이버 보안 데이터 없이 gpt-oss에서 모델을 미세 조정했다고 밝혔습니다. 따라서 원래 gpt-oss 출시 중에 수행된 위험 평가—특히 최악의 경우 시나리오를 추정하는 작업—은 gpt-oss-safeguard 시리즈에도 교차 적용됩니다.

Sources