OpenAI 모델 기반 SafetyKit 위험 에이전트
SafetyKit은 OpenAI의 가장 강력한 모델을 활용한 멀티모달 AI 에이전트를 배포하여 마켓플레이스, 결제 플랫폼 및 핀테크에서 사기 및 금지된 활동을 자동으로 탐지합니다. GPT-5, GPT-4.1 및 Computer Using Agent (CUA)와 같은 특수 도구를 통합함으로써 SafetyKit은 고객 콘텐츠 100%를 검토하면서 95% 이상의 정확도를 달성합니다.
모델별 에이전트 아키텍처
SafetyKit은 위험 카테고리에 따라 콘텐츠를 특정 에이전트로 라우팅하는 모델 매칭 방식을 사용합니다. 이 아키텍처는 작업 요구에 따라 모델 선택을 최적화하여 추론, 처리량 및 모달리티를 향상시킵니다:
- GPT-5: 텍스트, 이미지, UI 전반에 걸친 멀티모달 추론에 사용되어 숨겨진 위험을 식별하고 정밀하고 단계적인 의사결정을 지원합니다.
- GPT-4.1: 대량 모더레이션 워크플로우와 상세한 콘텐츠 정책 지침을 신뢰성 있게 준수하는 데 사용됩니다.
- Reinforcement Fine-Tuning (RFT): 복잡한 안전 정책에 대해 기본 모델 능력을 넘어 재현율과 정밀도를 향상시키기 위해 적용됩니다.
- Deep Research: 상인 검증 및 리뷰에 대한 실시간 온라인 조사에 통합됩니다.
- Computer Using Agent (CUA): 복잡한 정책 작업을 자동화하여 수동 인간 검토의 필요성을 줄이는 데 사용됩니다.
멀티모달 위험 탐지 및 정책 집행
SafetyKit 에이전트는 기존 키워드 기반 시스템이 종종 놓치는 복잡한 안전 작업을 처리합니다. 예를 들어 사기 이미지에 삽입된 전화번호를 탐지하거나 지역별 규정 준수 규칙을 적용하는 경우가 있습니다.
사기 탐지
사기 탐지 에이전트는 시각 및 텍스트 분석을 결합합니다. GPT-4.1을 사용해 이미지를 파싱하고 레이아웃을 이해하며, 제품 이미지에 삽입된 QR 코드나 전화번호와 같은 정책 위반을 식별합니다.
정책 공개
정책 공개 에이전트는 목록 및 랜딩 페이지에 필수 법적 면책 조항이나 지역별 경고가 포함되도록 보장합니다. 워크플로우는 GPT-4.1이 관련 섹션을 추출하고, 이어 GPT-5가 내부 정책 라이브러리와 비교해 해당 섹션에 필요한 문구가 존재하고 해당 지역에 필수인지 평가합니다.
성능 향상 및 확장성
SafetyKit은 새로운 OpenAI 모델 도입을 통해 운영 규모와 성능이 크게 향상되었습니다:
- Vision Task Improvements: GPT-5 배포로 가장 어려운 비전 작업에서 벤치마크 점수가 10점 이상 상승했습니다.
- Token Volume: 일일 토큰 처리량이 6개월 동안 2억에서 160억 토큰 이상으로 확장되었습니다.
- Rapid Integration: SafetyKit은 o3 및 GPT-5를 포함한 새로운 릴리스를 가장 어려운 사례에 대해 벤치마크하고, 종종 출시 당일에 최고 성능 모델을 배포합니다.
"OpenAI는 빠르게 움직이며, 우리는 시스템을 그에 맞게 설계했습니다. 새로운 릴리스마다 운영상의 이점을 제공해 이전에 지원하지 못했던 새로운 기능과 영역을 열어주고, 고객에게 제공하는 커버리지와 정확성을 높여줍니다."
—David Graunke, SafetyKit 설립자 겸 CEO
안전 운영에 미치는 영향
모든 고객 콘텐츠 검토를 자동화함으로써 SafetyKit은 인간 모더레이터가 공격적인 자료에 노출되는 것을 줄이고, 보다 미묘한 정책 결정에 집중할 수 있게 합니다. 이제 시스템은 결제 위험, 사기, 자금세탁 방지, 아동 착취 방지 등 광범위한 위험 영역을 포괄하며, 수억 명의 최종 사용자를 보유한 고객을 보호합니다.