OpenAI GPT-4 발표 및 기능 개요
TL;DR
OpenAI는 GPT‑4를 출시했으며, 이는 멀티모달(텍스트와 이미지) 대형 언어 모델로 모의 변호사 시험에서 상위 10 % 점수를 기록하고 다양한 전문 및 학술 벤치마크에서 인간 수준의 성능을 보여줍니다; 이 모델은 ChatGPT, 제한된 API, 그리고 오픈소스 평가 프레임워크를 통해 제공되고 있습니다.
핵심 기술 진보
예측 가능한 확장성과 안정적인 학습
- 지난 2년 동안 OpenAI는 딥러닝 스택을 재구축하고 Azure와 공동으로 워크로드에 특화된 슈퍼컴퓨터를 설계했습니다.
- GPT‑3.5는 테스트 실행으로 활용되었으며, 버그가 수정되고 이론적 기반이 GPT‑4 학습 전에 개선되었습니다.
- GPT‑4의 학습 실행은 이례적으로 안정적이었으며, OpenAI는 최종 손실을 정확히 예측하고 1,000‑10,000배 적은 연산을 사용한 실행으로부터 하위 작업의 통과율을 외삽할 수 있었습니다.
- 예측 가능한 확장은 안전 조치로 간주되어 조직이 향후 모델 능력을 사전에 예상할 수 있게 합니다.
멀티모달 입력 기능
- GPT‑4는 텍스트와 이미지 입력을 교차로 받아들이며, 비전‑언어 작업을 위해 텍스트 출력(코드 포함)을 생성합니다.
- 표준 학술 비전 벤치마크에서 성능이 뛰어나지만, 이미지 모달리티는 아직 연구용 프리뷰 단계이며 공개되지 않았습니다.
- 원래 텍스트 전용 모델을 위해 개발된 few‑shot 프롬프트와 chain‑of‑thought 추론과 같은 테스트 시 기술이 이미지 입력 작업에도 향상을 가져옵니다.
정렬 및 조정 가능성 개선
- 적대적 테스트와 ChatGPT 경험을 바탕으로 한 6개월 간의 반복 정렬을 통해 OpenAI 모델 중 사전 사실성, 조정 가능성, 가드레일 준수 측면에서 사상 최고 수준을 달성했습니다.
- 시스템 메시지를 통해 개발자(및 곧 ChatGPT 사용자)들은 톤, 상세도, 스타일을 지정할 수 있어 정책 범위 내에서 맞춤형 동작을 제공합니다.
- OpenAI는 현재 시스템 메시지가 가장 쉬운 탈옥 경로임을 인정하고, 이러한 제어를 강화하기 위해 사용자 피드백을 장려합니다.
벤치마크 성능
인간 수준 시험 결과
- GPT‑4는 모의 변호사 시험에서 응시자 상위 10 %에 해당하는 점수를 기록했으며, GPT‑3.5는 하위 10 %에 머물렀습니다.
- 작업별 별도 학습은 수행되지 않았으며, 모델은 공개된 시험 및 최신 연습 시험을 통해 평가되었습니다.
표준 언어 모델 벤치마크
- GPT‑4는 기존 대형 언어 모델 및 대부분의 최신(SOTA) 시스템을 전통적인 ML 벤치마크에서 능가합니다.
- MMLU 스위트(57개 과목에 걸친 14,000개의 객관식 항목)에서 GPT‑4는 GPT‑3.5 및 다른 LLM(Chinchilla, PaLM)을 26개 언어 중 24개에서 앞서며, 라트비아어, 웰시어, 스와힐리어와 같은 저자원 언어도 포함됩니다.
사실성 및 안전 지표
- 내부 적대적 사실성 평가에서 GPT‑3.5 대비 환각이 40 % 감소한 것으로 나타났습니다.
- RLHF 사후 학습 후, GPT‑4는 TruthfulQA에서 GPT‑3.5에 비해 큰 차이를 보이며 일반적인 오해를 저항하지만 여전히 미묘한 세부 사항을 놓칠 때가 있습니다.
제한 사항
- GPT‑4는 여전히 사실을 환각하고 추론 오류를 범합니다; 많은 실제 상황에서 인간보다 신뢰성이 낮습니다.
- 지식이 2021년 9월경에 끊겨 있으며, 모델은 새로운 경험으로부터 학습하지 않습니다.
- 기본 모델은 잘 보정되어 있지만, RLHF 후 신뢰도 점수의 보정이 악화됩니다.
- 출력에 편향이 지속되며, 탈옥 기법을 통해 허용되지 않은 행동을 유도할 수 있습니다.
안전 위험 및 완화 방안
- 위험은 이전 모델과 유사하지만(해로운 조언, 버그가 있는 코드, 잘못된 정보) 높은 능력으로 인해 증폭됩니다.
- AI 정렬, 사이버보안, 바이오리스크, 국제 안보 분야의 50명 이상의 외부 전문가가 적대적 테스트를 수행했으며, 이는 위험한 요청에 대한 거부 행동을 개선하기 위한 데이터 수집에 반영되었습니다.
- RLHF 중 추가 안전 보상 신호가 GPT‑4 제로샷 분류기를 훈련시켜 허용되지 않은 콘텐츠에 페널티를 부여합니다; 이는 GPT‑3.5 대비 금지된 요청에 대한 응답을 82 % 감소시키고 민감한 주제에 대한 준수를 29 % 증가시켰습니다.
- OpenAI는 모델 수준 개입과 함께 배포 시점의 안전 조치(모니터링, 악용 탐지)에 계속 의존합니다.
배포 세부 정보
ChatGPT Plus
- GPT‑4는 chatgpt.com에서 ChatGPT Plus 구독자에게 제공되며, 사용량 제한은 수요와 시스템 성능에 따라 조정됩니다.
API 접근
- 텍스트 전용 GPT‑4 접근은 표준 ChatCompletions API를 통해 제공되며, 개발자는 대기자 명단에 가입해야 합니다.
- 가격: 8,192‑토큰 컨텍스트 모델은 프롬프트 토큰 1k당 $0.03, 완성 토큰 1k당 $0.06; 32,768‑토큰 컨텍스트 변형(gpt‑4‑32k)은 각각 $0.06/$0.12.
- 기본 속도 제한: 분당 40k 토큰 및 200 요청.
- 연구자는 Researcher Access Program을 통해 보조 접근을 신청할 수 있습니다.
OpenAI Evals 프레임워크
- OpenAI는 자동 벤치마크를 생성하고 실행하기 위한 오픈소스 OpenAI Evals 프레임워크를 공개했습니다.
- Evals는 내부적으로 부족함을 식별하고 퇴보를 방지하는 데 사용되며, 외부 사용자(예: Stripe)도 이를 활용해 GPT 기반 도구를 평가했습니다.
- 저장소에는 일반적인 평가 패턴 템플릿이 포함되어 있으며, 여기에는 GPT‑4가 자체 출력을 평가하는 모델‑채점 evals가 있습니다.
- 커뮤니티 기여를 장려하여 프레임워크가 포착하는 실패 모드와 어려운 작업의 범위를 확대하고자 합니다.
시사점 및 전망
- GPT‑4의 멀티모달 능력과 향상된 정렬은 보다 유용하고 안전한 AI 어시스턴트로 나아가는 중요한 단계입니다.
- 예측 가능한 확장과 초기 안전 중심 훈련은 향후 모델 능력에 대한 더 나은 예측을 제공하려는 목표이며, OpenAI는 이를 사회 안전에 필수적인 관행이라고 주장합니다.
- 지속적인 제한 사항(환각, 편향, 오래된 지식)은 특히 고위험 적용 분야에서 인간 감독의 필요성을 강조합니다.
- 오픈소스 Evals 생태계와 협업 안전 테스트는 AI 평가와 위험 완화에 더 넓은 커뮤니티 참여로의 전환을 나타냅니다.
이 글은 OpenAI의 2023년 3월 GPT‑4 발표를 사실에 충실히 반영했으며, 내용 추가나 변경을 하지 않았습니다.
Sources
- OriginalGPT-4