OpenAI GPT-2 출시 및 영향

OpenAI는 일관된 문단 텍스트를 생성하고 여러 언어 모델링 벤치마크에서 최첨단 성능을 달성하는 대규모 비지도 언어 모델인 GPT-2를 개발했습니다. 이 모델은 작업별 훈련 없이 rudimentary reading comprehension, 기계 번역, 질문 answering, 요약을 수행할 수 있는 능력을 보여줍니다.

기술 아키텍처 및 훈련

GPT-2는 원래 GPT 모델의 직접적인 규모 확장으로, 파라미터가 10배 이상 많고 데이터도 10배 이상 많이 훈련되었습니다.

  • 모델 규모: 전체 모델은 15억 개의 파라미터를 포함합니다.
  • 훈련 목적: 모델은 이전 단어들을 기반으로 다음 단어를 예측하도록 단순히 훈련되었습니다.
  • 훈련 데이터: GPT-2는 Reddit에서 outward links를 통해 선별된 8백만 개의 웹 페이지(약 40GB의 인터넷 텍스트)로 구성된 데이터셋에서 훈련되었습니다. 여기서 최소 3개의 karma를 받은 링크만을 사용해 다양성과 품질을 보장했습니다.
  • 아키텍처: 트랜스포머 아키텍처를 기반으로 합니다.

제로샷 능력 및 성능

GPT-2는 "제로샷" 설정에서 다양한 도메인별 언어 모델링 작업에서 최첨단 점수를 달성합니다. 이는 해당 작업에 특화된 데이터로는 훈련되지 않았으며 최종 테스트로만 평가되었다는 의미입니다.

언어 모델링 벤치마크

GPT-2는 Wikipedia, 뉴스, 도서와 같은 도메인별 데이터셋에서 훈련된 모델들을 다음 벤치마크에서 앞섰습니다.

Dataset Metric GPT-2 Result Previous Record Human
Winograd Schema Challenge Accuracy (+) 70.70% 63.7% 92%+
LAMBADA Accuracy (+) 63.24% 59.23% 95%+
Children’s Book Test (Common Nouns) Accuracy (+) 93.30% 85.7% 96%
Children’s Book Test (Named Entities) Accuracy (+) 89.05% 82.3% 92%
Penn Tree Bank Perplexity (–) 35.76 46.54 unknown
WikiText-2 Perplexity (–) 18.34 39.14 unknown
enwik8 Bits per character (–) 0.93 0.99 unknown
text8 Bits per character (–) 0.98 1.08 unknown
WikiText-103 Perplexity (–) 18.34 18.3 unknown

일반 언어 작업

전문 시스템에 비해 최첨단 수준에 도달하지는 못하지만, GPT-2는 미세 조정 없이 훈련된 모델에 특정 프롬프트를 주어 읽기 이해, 요약, 번역과 같은 작업을 수행할 수 있습니다.

텍스트 생성 및 실패 모드

GPT-2는 임의의 입력 프롬프트에 기반하여 현실적이고 일관된 텍스트 continuations을 생성할 수 있습니다. 그러나 모델은 여러 가지 실패 모드를 보입니다:

  • 반복 텍스트: 모델은 반복적인 시퀀스를 생성할 수 있습니다.
  • 세계 모델링 실패: 모델은 때때로 논리적으로 불가능한 시나리오를 생성합니다(예: 물 속에서 발생하는 화재에 대해 쓰는 것).
  • 비자연적인 주제 전환: 모델은 주제를 갑자기 전환할 수 있습니다.

OpenAI는 주제에 따라 성능이 다르다고 언급하며, 훈련 데이터에서 altamente 표현된 주제(예: Brexit, 반지의 제왕)에 대해 더 성공적이고, altamente 기술적이거나 심오한 내용에 대해서는 성능이 낮다고 지적합니다.

정책 영향 및 오용 위험

OpenAI는 대규모 언어 모델에 대한 여러 가지 잠재적인 유익한 응용 프로그램과 악용 사례를 식별합니다:

잠재적 이점

  • AI 글쓰기 보조 도구
  • 유능한 대화 에이전트
  • 언어 간 비지도 번역
  • 더 나은 음성 인식 시스템

잠재적 악용 사례

  • 오도되는 뉴스 기사 생성
  • 온라인 사칭
  • 자동 콘텐츠 생산: 소셜 미디어를 위한 폭력적, 가짜, 또는 스팸/피싱 콘텐츠 생산 자동화.

OpenAI는 이러한 기술들이 가짜 콘텐츠 생성 비용과 허위 정보 캠페인 수행 비용을 낮춘다고 경고하며, 대중이 온라인 텍스트에 대해 더 회의적이어야 한다고 제안합니다.

출시 전략: 단계적 공개

규모가 큰 기만적 또는 폭언 언어 생성 가능성에 대한 우려로 인해, OpenAI는 단계적 출시를 통한 책임 있는 공개 실험을 구현했습니다:

  1. 초기 출시: 처음에는 훨씬 작은 버전의 GPT-2(117M 파라미터)와 샘플링 코드만 출시되었습니다.
  2. 중간 업데이트 (2019년 5월): 더 큰 345M 파라미터 버전이 출시되었습니다.
  3. 파트너 공유: 762M 및 1.5B 버전은 AI 및 보안 커뮤니티의 파트너에게만 독점적으로 공유되어 사회적 준비성을 향상시켰습니다.

OpenAI는 전체 데이터셋, 훈련 코드, 또는 1.5B 모델 가중치를 일반 대중에게 출시하지 않았습니다. 이 전략은 커뮤니티가 모델의 속성을 평가하고 각 출시 단계의 영향을 평가할 시간을 주기 위한 것이었습니다.

Sources