OpenAI GPT-3: Language Models as Few-Shot Learners
Overview
OpenAI는 1750억 개의 파라미터를 가진 자기회귀(autoregressive) 언어 모델인 GPT-3를 도입했습니다. 이 모델은 언어 모델의 규모를 확장하는 것이 작업 불가지론적(task-agnostic)인 퓨샷(few-shot) 성능을 크게 향상시킨다는 것을 보여주며, 그래디언트 업데이트나 미세 조정(fine-tuning) 없이 텍스트 상호작용을 통해 제공된 몇 가지 예시나 간단한 지침만으로 새로운 언어 작업을 수행할 수 있게 합니다.
Technical Architecture and Scaling
GPT-3는 1750억 개의 파라미터를 특징으로 하는 자기회귀 언어 모델로, 이는 이전의 어떤 비희소(non-sparse) 언어 모델보다 10배 더 많습니다. 파라미터 수를 확장함으로써, OpenAI 연구원들은 일반적으로 수천 개의 예시가 필요한 작업별 미세 조정 데이터셋 없이도 모델이 작업을 수행하는 능력이 향상된다는 것을 발견했습니다.
Few-Shot Learning Capabilities
GPT-3는 그래디언트 업데이트나 미세 조정 없이 NLP 작업에 적용됩니다. 대신, 작업과 퓨샷 데모는 순수하게 텍스트 상호작용을 통해 지정됩니다. 이 접근 방식은 모델이 다음과 같은 다양한 작업을 수행할 수 있게 합니다:
Translation and Question-Answering: 표준 NLP 데이터셋에서 강력한 성능을 보여줍니다.
Cloze Tasks: 텍스트에서 누락된 단어를 채웁니다.
On-the-fly Reasoning: 모델은 3자리 산술 연산과 단어 섞기 해제를 수행할 수 있습니다.
Domain Adaptation: 문장에서 새로운 단어를 사용합니다.
Human-Like Text Generation
주요 발견 중 하나는 GPT-3가 인간 평가자가 사람이 작성한 기사와 구별하기 어려울 정도로 뉴스 기사를 생성할 수 있다는 점입니다. 이 능력은 모델이 매우 일관성 있고 그럴듯한 텍스트를 생성할 수 있는 능력을 강조하지만, 연구원들은 이러한 고충실도 생성과 관련된 광범위한 사회적 영향을 인정합니다.
Limitations and Challenges
규모에도 불구하고, GPT-3는 여전히 일부 데이터셋에서 어려움을 겪으며 대규모 웹 코퍼스 학습과 관련된 방법론적 문제를 직면합니다. 이는 규모 확장이 퓨샷 성능을 향상시키지만, 규모 자체가 모든 NLP 문제를 해결하는 완전한 해결책은 아니라는 것을 나타냅니다.