OpenAI GPT-5 릴리즈 노트
OpenAI는 GPT-5를 도입했습니다. 이는 이전 모델에 비해 지능이 크게 향상된 통합 AI 시스템으로, 빠르고 효율적인 모델과 더 깊은 추론 모델(GPT-5 thinking)을 동적으로 선택하는 실시간 라우터를 통합하여 코딩, 수학, 작문, 건강 분야에서 최첨단 성능을 제공합니다.
통합 시스템 아키텍처
GPT-5는 세 가지 핵심 구성 요소로 이루어진 통합 시스템으로 작동합니다: 표준 질의에 대한 스마트하고 효율적인 모델, 복잡한 문제를 위한 더 깊은 추론 모델인 "GPT-5 thinking", 그리고 실시간 라우터. 라우터는 대화 복잡성, 도구 요구사항, 사용자 의도(예: "think hard about this"와 같은 프롬프트), 대화 유형에 따라 적절한 모델을 결정합니다.
연속적인 가용성을 보장하기 위해, 각 모델의 "mini" 버전이 기본 사용 제한에 도달하면 질의를 처리합니다. OpenAI는 향후 이러한 별도 기능들을 하나의 모델로 통합할 계획입니다.
기술 역량 및 도메인 성능
GPT-5는 여러 핵심 벤치마크에서 새로운 최첨단(SOTA) 결과를 달성했으며, 전문 분야에서 향상된 지능을 보여줍니다:
- Mathematics: AIME 2025에서 94.6% (도구 없이).
- Coding: SWE-bench Verified에서 74.9% 및 Aider Polyglot에서 88%.
- Multimodal Understanding: MMMU에서 84.2%.
- Health: HealthBench Hard에서 46.2%.
- General Science: GPT-5 pro는 도구 없이 GPQA에서 88.4%를 달성합니다.
코딩 및 개발
GPT-5는 현재까지 OpenAI가 제공한 가장 강력한 코딩 모델로, 대규모 저장소 디버깅 및 복잡한 프론트엔드 생성에서 구체적인 진보를 보입니다. 이 모델은 타이포그래피와 간격을 포함한 미적 디자인에 대한 직관적인 이해를 보여주어, 단일 프롬프트만으로 반응형 웹사이트와 앱을 생성할 수 있습니다.
건강 및 의료 정보
GPT-5는 이전 모델에 비해 HealthBench에서 훨씬 높은 점수를 기록합니다. 적극적인 사고 파트너 역할을 수행하며, 사전에 문제를 표시하고 명확한 질문을 제시합니다. 모델은 사용자의 지역, 지식 수준, 상황에 따라 응답을 조정하여 보다 안전하고 신뢰할 수 있는 정보를 제공합니다.
창의적 글쓰기 및 표현
이 모델은 자유시나 운율이 없는 iambic pentameter와 같은 구조적 모호성 및 문학적 깊이를 다루는 능력이 향상되어, 전문 보고서, 이메일, 메모 작성에 더욱 효과적입니다.
신뢰성, 사실성 및 정직성
GPT-5는 이전 모델에 비해 환각 및 기만적 행동을 크게 감소시켰습니다:
- Factuality: 응답이 GPT-4o에 비해 약 45% 적게 사실 오류를 포함합니다. "thinking" 모드를 사용할 경우, GPT-5는 OpenAI o3에 비해 약 80% 적게 사실 오류를 포함합니다.
- Open-Ended Factuality: LongFact 및 FActScore 벤치마크에서 "GPT-5 thinking"은 o3보다 환각이 6배 적게 발생했습니다.
- Honesty: 멀티모달 프롬프트에서 이미지가 제거된 테스트(CharXiv)에서 GPT-5는 존재하지 않는 이미지에 대해 자신 있는 답변을 9%만 제공했으며, o3는 86.7%였습니다. 프로덕션 트래픽에서 기만 비율은 o3의 4.8%에서 GPT-5의 2.1%로 감소했습니다.
안전 및 행동 개선
안전한 완성 패러다임
OpenAI는 단순한 거부 기반 안전 교육을 넘어 "safe completions" 접근법을 도입했습니다. 이 방법은 모델이 안전 경계 내에서 가능한 가장 도움이 되는 답변을 제공하도록 교육하며, 부분적인 답변이나 고수준 개요를 포함할 수 있습니다. 거부가 필요할 경우, 모델은 이유를 설명하고 안전한 대안을 제시하도록 훈련됩니다.
아첨 감소
GPT-5는 과도하게 동의하는 태도와 불필요한 이모지를 줄이도록 설계되었습니다. 목표 평가에서 아첨형 답변은 14.5%에서 6% 이하로 감소했으며, "박사 수준의 지능을 가진 친절한 친구"와 같은 어조를 목표로 합니다.
생물학적 위험 방어책
"GPT-5 thinking" 모델이 생물학 및 화학 분야에서 "High capability"로 분류되었기 때문에, OpenAI는 다층 방어 시스템을 구현했습니다. 여기에는 CAISI 및 UK AISI와 같은 파트너와의 5,000시간 레드팀 활동, 항상 작동하는 분류기, 그리고 생물학적 위험을 최소화하기 위한 추론 모니터가 포함됩니다.
GPT-5 Pro 및 접근 티어
GPT-5 pro는 OpenAI o3-pro를 대체합니다. 확장된 병렬 테스트 시 컴퓨팅을 활용하여 가장 복잡한 작업에 대한 확장된 추론을 제공합니다. 1,000개의 경제적으로 가치 있는 추론 프롬프트 평가에서 외부 전문가들은 "GPT-5 thinking"보다 GPT-5 pro를 67.8% 선호했으며, 주요 오류가 22% 감소했다고 언급했습니다.
사용 가능성:
- Free Users: 사용 제한에 도달하면 GPT-5에 접근하고, 이후 GPT-5 mini로 전환됩니다.
- Plus, Team, and Pro Users: 더 높은 사용 제한. Pro 구독자는 GPT-5에 무제한 접근 및 GPT-5 pro에 대한 독점 접근을 받습니다.
- Enterprise and Edu: 다음 주에 접근이 순차적으로 제공됩니다.
- Developer Access: Pro, Plus, Team 사용자를 위한 Codex CLI를 통해 이용 가능합니다.
Sources
- OriginalIntroducing GPT-5