GPT-2 1.5B 릴리스 노트
OpenAI는 단계적 출시 계획의 마지막이자 가장 큰 모델인 15억 파라미터 버전의 GPT-2를 출시했습니다. 이번 출시에는 합성 텍스트 탐지 도구 개발을 용이하게 하기 위한 모델 가중치와 코드가 포함되어 있습니다.
GPT-2 출력물에 대한 인간의 인식
인간은 1.5B 모델의 출력을 더 작은 버전보다 더 설득력 있다고 느끼지만, 774M 모델과 비교했을 때 신뢰도 향상은 미미합니다. 코넬 대학교에서 실시한 설문 조사에 따르면, 1.5B 모델은 10점 만점에 6.91점의 신뢰도 점수를 받았으며, 이는 774M 모델의 6.72점, 355M 모델의 6.07점과 비교됩니다.
오용 가능성 및 합성 프로파간다
GPT-2는 특정 이데올로기적 입장을 위한 합성 프로파간다를 생성하도록 미세 조정될 수 있습니다. Middlebury Institute of International Studies의 Center on Terrorism, Extremism, and Counterterrorism (CTEC)에서 수행된 연구에 따르면, 이 모델은 백인 우월주의, 마르크스주의, 지하드주의 이슬람주의, 아나키즘의 네 가지 이데올로기에 대해 미세 조정될 수 있음이 입증되었습니다.
합성 텍스트 탐지의 어려움
더 큰 모델이 분류하기 더 어려운 출력을 생성하기 때문에, 합성 텍스트의 콘텐츠 기반 탐지는 장기적인 과제로 남아 있습니다. OpenAI는 RoBERTa-BASE (125 million parameters)와 RoBERTa-LARGE (355 million parameters)를 기반으로 한 탐지 모델을 개발했으며, 이는 1.5B GPT-2가 생성한 텍스트에 대해 약 95%의 탐지율을 달성합니다.
OpenAI는 이 정확도가 단독 탐지용으로는 불충분하며 메타데이터 기반 접근 방식, 인간의 판단, 그리고 대중 교육과 결합되어야 한다고 언급합니다. 또한 회사는 더 큰 모델의 출력물로 학습할 때 탐지 견고성이 향상되지만, 모델 크기가 커질수록 분류의 전반적인 어려움이 증가한다는 것을 관찰했습니다.
오용의 증거
현재 GPT-2의 광범위한 오용에 대한 강력한 증거는 없습니다. 피싱이나 스팸과 같은 대량 발생, 저수익 운영의 가능성에 대한 논의는 있었지만, OpenAI는 이 모델이 코드를 작성하거나, 문서를 작성하거나, 또는 다른 악의적인 사례에 사용된 증거를 발견하지 못했습니다.
편향 분석 및 표준
언어 모델은 본질적으로 편향을 포함합니다. 이를 해결하기 위해 OpenAI는 두 가지 주요 전략을 구현했습니다:
- Model Cards: GitHub에 모델 카드를 게시하여 언어 모델의 내재된 문제를 문서화합니다.
- Qualitative Evaluation: 모델 카드를 구성하기 위한 성별, 인종, 종교적 편향에 대한 사내 조사를 수행합니다.
OpenAI는 이러한 조사가 포괄적이지 않음을 강조하며, AI 연구 커뮤니티가 표준화된 편향 분석 프레임워크에 협력할 필요가 있음을 강조합니다.
책임 있는 게시 규범
GPT-2의 출시는 단계적 출시 프로세스의 테스트 케이스로 활용되었습니다. OpenAI는 Partnership on AI의 ‘Responsible Publication Norms for Machine Learning’ 프로젝트에 참여함으로써 머신러닝을 위한 책임 있는 게시 규범을 수립하는 작업을 계속하고 있습니다.
Sources
- OriginalGPT-2: 1.5B release