OpenAI AI 텍스트 분류기 출시 (2023년 1월)
TL;DR
OpenAI는 2023년 1월 31일에 무료이며 공개적으로 이용 가능한 AI 텍스트 분류기를 출시하여 AI가 작성한 영어 콘텐츠를 감지하도록 했지만, 이 도구는 제한적입니다: AI가 생성한 텍스트 중 26%만 정확히 표시하고 인간이 작성한 텍스트에서는 9%의 오탐률을 보이며, 이후 낮은 정확도 때문에 철회되었습니다.
분류기가 하는 일
분류기는 인간이 쓴 텍스트와 AI가 쓴 텍스트를 구별하는 파인‑튜닝된 언어 모델입니다. 동일한 프롬프트에 대해 인간과 OpenAI 및 기타 제공자의 다양한 언어 모델이 답변한 쌍으로 이루어진 데이터셋으로 학습되었습니다. 웹 데모에서는 오탐을 낮추기 위해 높은 신뢰 임계값을 설정했으며, 모델이 매우 확신할 때만 텍스트를 "가능한 AI‑작성"으로 라벨링합니다.
보고된 성능
- 진양성률: 영어 AI‑생성 텍스트 도전 세트에서 26%.
- 오양성률: 인간이 작성한 텍스트 중 9%가 잘못 AI‑작성으로 라벨링됨.
- 길이 의존성: 입력이 길어질수록 정확도가 향상되며, 1,000자 미만 텍스트에서는 특히 신뢰성이 낮습니다.
- 이전 연구와 비교: 새로운 모델은 GPT‑2 출력 데이터셋과 함께 공개된 OpenAI의 이전 탐지기보다 훨씬 신뢰성이 높습니다.
주요 제한 사항
- 결정 도구가 아님: 분류기는 보조 신호로만 사용해야 하며, 최종 판단을 내리는 도구가 아닙니다.
- 짧은 텍스트 약점: 1,000자 미만 입력은 매우 신뢰할 수 없는 예측을 제공합니다.
- 언어 및 도메인 범위: 영어에만 최적화되어 있으며, 다른 언어와 코드에 대해서는 성능이 저조합니다.
- 예측 가능한 내용: 결정론적 텍스트(예: 소수 목록)는 구별할 수 없습니다.
- 적대적 편집: 인간이 편집하면 탐지를 회피할 수 있으며, 지속적인 공격이 재학습을 앞설 수 있습니다.
- 보정 문제: 학습 분포 밖에서는 모델이 잘못된 예측에 대해 과도하게 자신감을 가질 수 있습니다.
학습 데이터 및 방법론
OpenAI는 사전 학습 코퍼스와 InstructGPT에 제출된 인간 시연에서 추출한 인간‑작성 발췌문 데이터셋을 구성했습니다. 각 발췌문은 프롬프트와 응답으로 나뉘었습니다. 각 프롬프트에 대해 OpenAI 자체 모델과 타 조직 모델을 포함한 여러 언어 모델이 응답을 생성했습니다. 이후 분류기는 이러한 인간‑AI 쌍을 기반으로 파인‑튜닝되었습니다.
의도된 사용 사례 및 홍보
OpenAI는 여러 잠재적 활용 사례를 강조합니다:
- 인간 대화로 위장한 자동화된 허위 정보 캠페인 탐지.
- AI 도구를 사용해 작성된 논문을 식별함으로써 학문적 부정행위 방지.
- AI 챗봇을 인간 대화자로 오인하는 것을 방지.
또한 연구실은 ChatGPT 활용에 관한 예비 교육 자료를 공개하고, 교사, 관리자, 학생, 학부모의 의견을 공개 양식을 통해 수집했습니다. OpenAI는 이 분류기가 텍스트, 오디오, 시각 콘텐츠에 대한 출처 추적 기술을 개발하기 위한 광범위한 노력의 일부임을 강조합니다.
현재 상황
2023년 7월 20일 현재, AI 텍스트 분류기는 낮은 정확도 때문에 오프라인으로 전환되었습니다. OpenAI는 보다 효과적인 출처 추적 방법을 연구하고 있으며, 사용자가 콘텐츠가 AI‑생성인지 판단할 수 있도록 돕는 도구를 제공하기 위해 계속 노력하고 있습니다.
저자: Jan Hendrik Kirchner, Lama Ahmad, Scott Aaronson, Jan Leike