OpenAI GPT-4 출시
OpenAI는 이전 모델인 GPT-3.5에 비해 현저히 향상된 추론 능력, 더 넓은 일반 지식, 그리고 복잡한 문제를 해결하는 데 있어 더 높은 정확도를 보여주는 대규모 언어 모델인 GPT-4를 출시했습니다. 이번 출시는 더 많은 데이터와 연산량을 활용하여 더욱 정교한 딥러닝 모델을 생성하는 OpenAI의 스케일링 전략의 연속을 의미합니다.
고급 추론 및 문제 해결
GPT-4는 복잡한 추론 작업과 창의적 협업에서 우수한 성능을 보여줍니다. 노래 작곡이나 시나리오 작성과 같은 기술적 및 창의적 글쓰기 작업을 생성, 편집 및 반복할 수 있으며, 사용자의 특정 글쓰기 스타일에 적응할 수 있습니다.
실제적인 추론 테스트에서 GPT-4는 일정 관리 및 논리 문제에서 GPT-3.5를 능가합니다. 예를 들어, 세 사람의 30분 회의 가능 시간을 조정해야 하는 시나리오에서 GPT-4는 공통 가능한 시간대(오후 12시 - 오후 12시 30분)를 정확히 식별하지만, GPT-3.5는 올바른 시간대를 식별하지 못합니다.
표준화된 시험 성적
GPT-4는 전문직 및 학술 시험 응시자들 사이의 점수 백분위수에서 뚜렷한 향상을 보여줍니다:
- Uniform Bar Exam: GPT-4는 90번째 백분위수에 도달했으며, 이는 GPT-3.5의 10번째 백분위수와 대조됩니다.
- Biology Olympiad: GPT-4 (with vision)는 99번째 백분위수에 도달했으며, 이는 GPT-3.5의 31번째 백분위수와 대조됩니다.
안전성 및 정렬(Alignment) 개선 사항
OpenAI는 GPT-4를 더 안전하고 정렬된 상태로 만들기 위해 6개월을 집중했습니다. 내부 평가에 따르면, GPT-4는 허용되지 않는 콘텐츠에 대한 요청에 응답할 가능성이 82% 낮아졌으며, GPT-3.5보다 사실적인 응답을 생성할 가능성이 40% 더 높습니다.
이러한 개선 사항은 다음과 같은 몇 가지 핵심적인 방법을 통해 달성되었습니다:
- Training with Human Feedback: 모델은 ChatGPT 사용자가 제출한 데이터와 AI 안전 및 보안 분야의 50명 이상의 전문가로부터 받은 초기 피드백을 포함하여 더 많은 인간의 피드백을 통합했습니다.
- Real-World Application: 이전 모델들의 실제 배포 과정에서 얻은 교훈을 안전 연구 및 모니터링 시스템에 통합했습니다.
- GPT-4-Assisted Research: 모델 자체의 추론 및 지시 이행 능력을 사용하여 미세 조정(fine-tuning)을 위한 훈련 데이터를 생성하고, 훈련 및 모니터링을 위한 분류기(classifier)를 반복적으로 개선했습니다.
인프라 및 한계점
GPT-4는 Microsoft Azure AI 슈퍼컴퓨터에서 훈련되었으며, 이는 사용자들에게 전 세계적으로 서비스를 제공하는 데에도 도움을 줍니다.
이러한 발전에도 불구하고, OpenAI는 GPT-4가 사회적 편향, 환각(hallucinations), 그리고 적대적 프롬프트(adversarial prompts)에 취약하다는 점을 포함하여 알려진 한계점이 있음을 인정합니다. 회사는 투명성, 사용자 교육, 그리고 미래 모델을 형성하기 위한 대중의 의견을 확대하여 이러한 문제를 해결하는 것을 목표로 합니다.
가용성
GPT-4는 ChatGPT Plus를 통해 사용자들에게 제공되며, 개발자들이 애플리케이션과 서비스를 구축할 수 있도록 API로도 제공됩니다.
Sources
- OriginalGPT-4