GPT-4를 사용한 콘텐츠 모더레이션

OpenAI는 GPT-4를 활용하여 콘텐츠 모더레이션을 자동화하고 정교화함으로써 콘텐츠 정책을 개발하고 맞춤화하는 데 필요한 시간을 개월에서 시간으로 단축하고 있습니다. 이 접근 방식은 인간 모더레이터의 역할을 수동 콘텐츠 필터링에서 고수준 정책 정교화 및 복잡한 엣지 케이스 처리로 전환합니다.

GPT-4를 사용한 정책 개발 가속화

GPT-4는 정책 지침의 라벨링 및 테스트를 자동화함으로써 콘텐츠 모더레이션 분류기의 빠른 생성 및 배포를 가능하게 합니다. 느린 수동 콘텐츠 선별에 의존하는 대신, 정책 전문가는 LLM과의 반복 루프를 사용하여 규칙을 정교화합니다:

  1. 골든 세트 생성: 정책 전문가는 소수의 예시를 식별하고 작성된 정책에 따라 라벨을 지정합니다.
  2. 모델 라벨링: GPT-4는 정책을 읽고 인간의 답변을 보지 않은 채 동일한 데이터셋에 라벨을 할당합니다.
  3. 불일치 분석: 전문가는 GPT-4의 판단과 인간 라벨 간의 차이를 검토합니다. GPT-4에게 라벨 뒤에 있는 이유를 제공하도록 요청함으로써 전문가는 정책 정의의 모호성을 식별하고 추가 설명을 제공할 수 있습니다.

이 사이클은 정책 품질이 만족스러울 때까지 반복되며, 이때 정교화된 정책은 대규모 배포를 위한 분류기로 변환됩니다.

모델 증류를 통한 모더레이션 확장

대량의 데이터를 효율적으로 관리하기 위해 OpenAI는 GPT-4의 예측을 사용하여 더 작고 효율적인 모델을 미세 조정합니다. 이를 통해 시스템은 실시간 콘텐츠 모더레이션에 필요한 규모와 속도로 작동하면서 GPT-4의 정교한 추론을 유지할 수 있습니다.

미래 개선 및 위험 탐지

OpenAI는 모더레이션 예측의 품질을 향상시키고 새로운 위험을 발견하기 위해 여러 가지 기술적 방법을 탐구하고 있습니다:

  • 추론 개선: 예측 정확성을 높이기 위해 사고사슬(chain-of-thought) reasoning과 자기 비판(self-critique)을 통합합니다.
  • 선제적 위험 식별: 피해에 대한 고수준 설명(Constitutional AI에서 영감을 얻음)을 기반으로 잠재적으로 유해한 콘텐츠를 식별하기 위해 모델을 사용합니다. 이러한 결과는 기존 정책을 업데이트하거나 완전히 새로운 위험 영역을 위한 정책을 만드는 데 사용됩니다.

인간-인-더-루프 및 편향 완화

AI 훈련 편향과 관련된 위험을 완화하기 위해 인간 감독은 모더레이션 프로세스에서 여전히 중요합니다. 언어 모델 판단은 원치 않는 편향에 취약할 수 있으므로 OpenAI는 출력을 모니터링, 검증, 정제하기 위해 인간-인-더-루프 시스템을 유지합니다. 이 전략은 반복적인 필터링 작업에서 인적 자원을 전환하여 지속적인 정책 개선에 필요한 복잡한 엣지 케이스에 집중할 수 있게 합니다.

Sources