OpenAI gpt-oss-safeguard 모델, Ollama를 통해 공개

TL;DR

OpenAI, Ollama, ROOST는 Apache 2.0 라이선스 하에 오픈소스 gpt-oss-safeguard 모델(20B 및 120B 파라미터)을 공개하며, 사용자 정의 정책을 해석하고 사고 흐름을 노출하는 추론 기반 안전성 분류기 제공.


모델 가용성 및 라이선스

핵심 요약: 모델은 무료로 다운로드 및 Ollama를 통해 실행 가능하며, 상업적 또는 실험적 사용 시 저작권 및 특허 문제 없이 자유롭게 사용 가능.

  • 두 가지 모델 크기 제공: gpt-oss-safeguard:20bgpt-oss-safeguard:120b.
  • 설치 단계 간단: Ollama 다운로드 후 ollama run gpt-oss-safeguard:20b (또는 :120b) 실행.
  • Apache 2.0 라이선스는 수정, 재배포, 상용 배포에 제한 없음.

핵심 기술적 특징

핵심 요약: 모델은 안전성 추론을 위해 특별히 설계되었으며, 사용자 정의 정책 지원, 투명한 추론 출력, 조정 가능한 추론 노력 기능 제공.

안전성 중심 훈련

  • 입력-출력 필터링, 온라인 콘텐츠 레이블링, 오프라인 신뢰 및 안전 파이프라인과 같은 안전성 분류 작업에 대해 명시적으로 훈련 및 미세 조정됨.

사용자 정의 정책 도입 (BYOP)

  • 추론 시 텍스트 기반 정책 설명을 입력받아, 추가적인 엔지니어링 없이 다양한 제품에 적용.

원시 점수 대신 추론된 결정

  • 전체 사고 흐름(CoT) 설명을 반환하여 개발자가 결정을 디버그하고 감사할 수 있음.
  • 원시 CoT 출력은 최종 사용자가 아닌 안전 전문가를 위한 것.

조정 가능한 추론 노력

  • 낮음, 중간, 높음의 추론 노력 수준 선택 가능하며, 지연 시간과 분석 깊이 간의 트레이드오프 가능.

평가 결과

핵심 요약: OpenAI 내부 및 외부 벤치마크 결과에 따르면, gpt-oss-safeguard는 여러 동시 정책에 대해 정확하게 텍스트를 분류하며, 기존 모더레이션 데이터셋에서도 경쟁력 있는 성능을 보임.

  • 내부 다중 정책 테스트: 모델의 레이블이 모든 제공된 정책에 대해 금본(골드) 세트와 일치할 때 정확도 측정, 엄격한 기준.
  • OpenAI 모더레이션 데이터셋(2022): OpenAI의 2022년 모더레이션 연구 논문과 함께 공개된 동일한 데이터셋에서 평가.
  • ToxicChat 벤치마크: 오픈소스 챗봇에 대한 실제 사용자 쿼리를 반영하는 공개 ToxicChat 벤치마크에서 성능 측정.

내부 다중 정책 평가 OpenAI 모더레이션 벤치마크 ToxicChat 벤치마크


커뮤니티 및 조직적 맥락

핵심 요약: ROOST라는 오픈소스 안전 도구 전문 비영리 단체의 지원을 받으며, 투명하고 커뮤니티 기반의 AI 안전 인프라 구축을 위한 더 넓은 움직임의 일환.

“gpt-oss-safeguard는 ‘자신의 정책과 해악 정의를 가져오세요’ 설계를 가진 최초의 오픈소스 추론 모델입니다. 조직은 중요한 안전 기술을 자유롭게 연구하고 수정하며 사용할 권리가 있으며, 혁신을 이어가야 합니다. 저희 테스트 결과, 다양한 정책을 이해하고 그 이유를 설명하며 정책 적용 시 미묘한 차이를 보이는 데 뛰어났으며, 이는 개발자와 안전 팀에게 유익할 것이라 생각합니다.”Vinay Rao, ROOST CTO

ROOST 소개

  • ROOST(Robust Open Online Safety Tools)는 2025년 설립된 비영리 단체로, 디지털 조직에 고품질 오픈소스 안전 도구를 제공.
  • 기술 기업, 기부 단체, 학계의 협동체가 지원.

시작하기 자료

핵심 요약: 개발자는 공식 가이드 및 커뮤니티 저장소를 따라 모델을 파이프라인에 통합할 수 있음.


AI 안전 생태계에 미치는 영향

핵심 요약: OpenAI와 파트너들이 높은 용량의 정책 기반 안전 모델을 허용성 있는 라이선스 하에 공개함으로써, 조직이 강력한 콘텐츠 모더레이션을 구현하는 장벽을 낮추며, 산업 및 연구 분야에서 책임감 있는 AI 실천의 채택을 가속화할 수 있음.

  • BYOP 설계로 맞춤형 안전 모델 훈련 필요성 감소, 소규모 팀의 자원 절약.
  • 투명한 추론은 신뢰를 쌓고, 설명이 요구되는 규제 준수를 촉진.
  • 오픈 라이선스는 커뮤니티 감사, 확장, 다양한 생태계와의 통합을 장려하여 벤더 종속성 위험 완화.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch