OpenAI 언어 모델 안전 및 오용에 대한 교훈

OpenAI는 AI 시스템의 실제 배포가 고립된 연구로는 얻을 수 없는 중요한 안전 및 오용 인사이트를 제공한다는 것을 확인했습니다. 주요 교훈은 API 기반 오용이 초기 이론적 우려와는 다른 형태로 나타나는 경우가 많으며, 정렬과 같은 근본적인 안전 연구가 AI 시스템의 상업적 유용성을 직접 향상시킨다는 점입니다.

위험 완화를 위한 반복적 배포 전략

OpenAI는 책임 있는 배포를 위한 단일 "만능 해결책"이 없기 때문에, 이익을 극대화하고 위험을 최소화하기 위해 지속적인 반복 접근 방식을 사용합니다. 이 전략은 작은 규모에서 학습한 뒤 더 큰 사용자 집단으로 확장하는 데 초점을 맞춥니다.

배포 수명 주기의 핵심 요소는 다음과 같습니다:

  • 배포 전 분석: 레드팀 도구와 안전 평가 활용(예: InstructGPT의 안전성 저하 여부 확인).
  • 점진적 롤아웃: GPT-3 및 InstructGPT 시리즈와 같은 모델을 사전 베타 형태로 시작해 초기 사용자 기반을 제한.
  • 파일럿 연구: 소수 고객을 대상으로 장문 콘텐츠 생성 등 새로운 사용 사례를 테스트해 안전 조건을 판단.
  • 사용 모니터링: 토큰 할당량, 속도 제한, 사용 사례 검토 등을 구현해 모델 사용 현황을 가시화.
  • 사후 검토: 주요 배포와 안전 사고에 대한 상세 분석 수행.

해를 더욱 줄이기 위해 OpenAI는 사전 학습 데이터 정제, 명령 수행을 위한 파인튜닝, 유해 출력 검열 도구 제작 등 개발 파이프라인 전반에 개입을 통합합니다.

언어 모델 오용 패턴

OpenAI는 초기에는 영향력 작전이나 오해를 불러일으키는 정치 콘텐츠·악성코드 생성과 같은 고위험을 중점적으로 다루었지만, 실제 데이터는 보다 넓은 스펙트럼의 오용을 보여줍니다.

OpenAI는 예상치 못했거나 기대보다 더 흔한 목적을 위해 GPT-3를 오용하려는 수백 명의 행위를 감지하고 차단했습니다. "현장에서" 발견된 오용 사례는 다음과 같습니다:

  • 의심스러운 의료 제품에 대한 스팸 홍보.
  • 인종 차별적 환상을 역할극하는 행위.

특히, OpenAI는 원래 장문 영향력 작전을 억제하기 위해 도입한 출력 길이 제한이 정책 위반을 크게 줄이지 못한다는 것을 발견했습니다. 이제 조직은 오히려 짧은 형태의 콘텐츠가 오해를 증폭시키는 위험이 더 클 수 있다고 보고 있습니다.

위험 및 영향 측정의 과제

기존 학술 벤치마크는 실제 운영 환경에서 마주치는 안전·오용 위험을 충분히 반영하지 못하는 경우가 많습니다. OpenAI는 학술 데이터셋의 여러 한계를 확인했는데, 여기에는 지나치게 좁은 초점(예: 직업 성별 편향만 측정), AI 사용의 생성적 차원을 측정하지 못함, 실제 사용 사례와 스타일이 다른 프롬프트 등이 포함됩니다.

이 격차를 메우기 위해 OpenAI는 다음을 개발하고 있습니다:

  • 새로운 평가 지표: 모델 출력의 독성 측정을 위한 지표.
  • 사내 분류기: 증오 발언, 폭력, 괴롭힘, 자해, 에로틱 콘텐츠 등 정책 위반 내용을 탐지하는 도구.

이 분류기는 사전 학습 데이터 필터링과 데이터셋 개입 효과 측정에 모두 사용됩니다. 또한 OpenAI는 모델의 경제적 영향을 연구하고 있으며, 카피라이팅·요약 작업에서 생산성 향상이 크게 나타났지만 노동 시장에 미치는 순 효과는 아직 명확하지 않다고 언급합니다.

안전과 상업적 유용성의 시너지

안전 연구는 직접적인 상업적 이점을 제공하며, 정렬과 유용성 사이에 시너지를 창출합니다.

이 시너지의 증거는 다음과 같습니다:

  • InstructGPT 선호도: 개발자들은 기본 GPT-3 모델보다 InstructGPT 모델을 훨씬 선호합니다. 이는 사용자의 의도를 따르고 유해하거나 부정확한 출력을 덜 생성하도록 파인튜닝되었기 때문이며, 이러한 정렬 작업은 원래 장기 안전 목표에서 시작되었습니다.
  • 마찰 감소: 정렬된 모델은 복잡한 "프롬프트 엔지니어링" 필요성을 줄여 모델 컨텍스트 창의 공간을 절약합니다.
  • 진실성: 인터넷에서 정보를 검색해 보다 진실된 답변을 제공하는 연구는 안전성과 제품 가치 모두를 향상시킵니다.
  • 운영상의 이점: 스팸 방지를 위한 속도 제한은 고객이 비용을 관리하는 데도 도움이 됩니다.

이러한 시너지에도 불구하고 OpenAI는 안전과 유용성이 상충할 수 있음을 인정합니다. 예를 들어, 더 강력한 시스템은 더 긴 평가 기간이 필요해 수익 기회를 지연시킬 수 있습니다.

외부 협업 및 연구

OpenAI는 AI 안전에 대한 모든 답을 한 조직이 가지고 있지는 않다고 강조합니다. 생태계를 개선하기 위해 다음과 같은 이니셔티브를 시행했습니다:

  • API 접근: API 대기열을 종료해 더 많은 사람들이 최첨단 시스템을 직접 사용하고 이해할 수 있게 함.
  • 보조 크레딧: 편향 및 오용에 초점을 맞춘 외부 연구자에게 API 크레딧 제공.
  • 노동 시장 연구: Codex 계열 모델의 경제적 영향을 다루는 연구 의제를 발표하고, 외부 협력자를 모집해 이러한 효과를 조사하도록 독려.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch