OpenAI GPT-2 출시 및 영향
OpenAI는 일관된 문단 텍스트를 생성하고 여러 언어 모델링 벤치마크에서 최첨단 성능을 달성하는 대규모 비지도 언어 모델인 GPT-2를 개발했습니다. 이 모델은 작업별 훈련 없이 rudimentary reading comprehension, 기계 번역, 질문 answering, 요약을 수행할 수 있는 능력을 보여줍니다.
기술 아키텍처 및 훈련
GPT-2는 원래 GPT 모델의 직접적인 규모 확장으로, 파라미터가 10배 이상 많고 데이터도 10배 이상 많이 훈련되었습니다.
- 모델 규모: 전체 모델은 15억 개의 파라미터를 포함합니다.
- 훈련 목적: 모델은 이전 단어들을 기반으로 다음 단어를 예측하도록 단순히 훈련되었습니다.
- 훈련 데이터: GPT-2는 Reddit에서 outward links를 통해 선별된 8백만 개의 웹 페이지(약 40GB의 인터넷 텍스트)로 구성된 데이터셋에서 훈련되었습니다. 여기서 최소 3개의 karma를 받은 링크만을 사용해 다양성과 품질을 보장했습니다.
- 아키텍처: 트랜스포머 아키텍처를 기반으로 합니다.
제로샷 능력 및 성능
GPT-2는 "제로샷" 설정에서 다양한 도메인별 언어 모델링 작업에서 최첨단 점수를 달성합니다. 이는 해당 작업에 특화된 데이터로는 훈련되지 않았으며 최종 테스트로만 평가되었다는 의미입니다.
언어 모델링 벤치마크
GPT-2는 Wikipedia, 뉴스, 도서와 같은 도메인별 데이터셋에서 훈련된 모델들을 다음 벤치마크에서 앞섰습니다.
| Dataset | Metric | GPT-2 Result | Previous Record | Human |
|---|---|---|---|---|
| Winograd Schema Challenge | Accuracy (+) | 70.70% | 63.7% | 92%+ |
| LAMBADA | Accuracy (+) | 63.24% | 59.23% | 95%+ |
| Children’s Book Test (Common Nouns) | Accuracy (+) | 93.30% | 85.7% | 96% |
| Children’s Book Test (Named Entities) | Accuracy (+) | 89.05% | 82.3% | 92% |
| Penn Tree Bank | Perplexity (–) | 35.76 | 46.54 | unknown |
| WikiText-2 | Perplexity (–) | 18.34 | 39.14 | unknown |
| enwik8 | Bits per character (–) | 0.93 | 0.99 | unknown |
| text8 | Bits per character (–) | 0.98 | 1.08 | unknown |
| WikiText-103 | Perplexity (–) | 18.34 | 18.3 | unknown |
일반 언어 작업
전문 시스템에 비해 최첨단 수준에 도달하지는 못하지만, GPT-2는 미세 조정 없이 훈련된 모델에 특정 프롬프트를 주어 읽기 이해, 요약, 번역과 같은 작업을 수행할 수 있습니다.
텍스트 생성 및 실패 모드
GPT-2는 임의의 입력 프롬프트에 기반하여 현실적이고 일관된 텍스트 continuations을 생성할 수 있습니다. 그러나 모델은 여러 가지 실패 모드를 보입니다:
- 반복 텍스트: 모델은 반복적인 시퀀스를 생성할 수 있습니다.
- 세계 모델링 실패: 모델은 때때로 논리적으로 불가능한 시나리오를 생성합니다(예: 물 속에서 발생하는 화재에 대해 쓰는 것).
- 비자연적인 주제 전환: 모델은 주제를 갑자기 전환할 수 있습니다.
OpenAI는 주제에 따라 성능이 다르다고 언급하며, 훈련 데이터에서 altamente 표현된 주제(예: Brexit, 반지의 제왕)에 대해 더 성공적이고, altamente 기술적이거나 심오한 내용에 대해서는 성능이 낮다고 지적합니다.
정책 영향 및 오용 위험
OpenAI는 대규모 언어 모델에 대한 여러 가지 잠재적인 유익한 응용 프로그램과 악용 사례를 식별합니다:
잠재적 이점
- AI 글쓰기 보조 도구
- 유능한 대화 에이전트
- 언어 간 비지도 번역
- 더 나은 음성 인식 시스템
잠재적 악용 사례
- 오도되는 뉴스 기사 생성
- 온라인 사칭
- 자동 콘텐츠 생산: 소셜 미디어를 위한 폭력적, 가짜, 또는 스팸/피싱 콘텐츠 생산 자동화.
OpenAI는 이러한 기술들이 가짜 콘텐츠 생성 비용과 허위 정보 캠페인 수행 비용을 낮춘다고 경고하며, 대중이 온라인 텍스트에 대해 더 회의적이어야 한다고 제안합니다.
출시 전략: 단계적 공개
규모가 큰 기만적 또는 폭언 언어 생성 가능성에 대한 우려로 인해, OpenAI는 단계적 출시를 통한 책임 있는 공개 실험을 구현했습니다:
- 초기 출시: 처음에는 훨씬 작은 버전의 GPT-2(117M 파라미터)와 샘플링 코드만 출시되었습니다.
- 중간 업데이트 (2019년 5월): 더 큰 345M 파라미터 버전이 출시되었습니다.
- 파트너 공유: 762M 및 1.5B 버전은 AI 및 보안 커뮤니티의 파트너에게만 독점적으로 공유되어 사회적 준비성을 향상시켰습니다.
OpenAI는 전체 데이터셋, 훈련 코드, 또는 1.5B 모델 가중치를 일반 대중에게 출시하지 않았습니다. 이 전략은 커뮤니티가 모델의 속성을 평가하고 각 출시 단계의 영향을 평가할 시간을 주기 위한 것이었습니다.