OpenAI GPT-5.2 릴리스 노트
OpenAI는 전문 지식 작업을 위한 모델 시리즈인 GPT-5.2를 도입했습니다. 이 출시에는 GPT-5.2 Instant, GPT-5.2 Thinking, GPT-5.2 Pro 세 가지 변형이 포함되며, 이들은 일반 지능, 장기 컨텍스트 이해, 에이전트형 도구 호출, 시각 기능을 collectively 향상시킵니다.
전문 지식 작업과 GDPval
GPT-5.2 Thinking은 44개 직업에 걸친 잘 정의된 지식 작업 과제를 측정하는 벤치마크인 GDPval에서 인간 전문가 수준 이상을 달성한 최초의 OpenAI 모델입니다. 이는 업계 최고 전문가와의 비교에서 70.9%에서 앞서거나 동점을 기록합니다.
전문 작업의 주요 성능 지표는 다음과 같습니다:
- 효율성: GPT-5.2 Thinking은 전문가보다 11배 이상 빠른 속도로 출력을 생성하며 비용은 전문가의 1% 미만입니다.
- 재무 모델링: 내부 주니어 투자은행 분석가 스프레드시트 작업에서 GPT-5.2 Thinking은 68.4%를 기록했으며, 이는 GPT-5.1의 59.1%보다 9.3% 향상된 수치입니다.
- 결과물: 이 모델은 인력 계획 모델, 스프레드시트, 프레젠테이션 생성을 더욱 정교하게 수행합니다.
소프트웨어 엔지니어링 및 코딩
GPT-5.2 Thinking은 SWE-Bench Pro(네 가지 언어를 테스트)에서 55.6%, SWE-bench Verified에서 80%를 기록하며 소프트웨어 엔지니어링 분야에서 새로운 최첨단 상태를 확립했습니다.
코딩에서의 기술적 개선 사항은 다음과 같습니다:
- 엔드-투-엔드 실행: 프로덕션 코드 디버깅, 기능 요청 구현, 대형 코드베이스 리팩터링의 신뢰성이 향상되었습니다.
- 프론트엔드 개발: 비전통적인 UI 작업 및 3D 요소에 대한 역량이 강화되었습니다.
- 에이전트형 통합: Windsurf CEO Jeff Wang을 포함한 초기 테스터들은 GPT-5.2가 에이전트형 코딩에서 상당한 도약을 나타내며, 취약한 다중 에이전트 시스템을 단일 '메가-에이전트'로 통합할 수 있다고 지적했습니다.
장기 컨텍스트 추론 및 시각
GPT-5.2 Thinking은 256k 토큰까지의 컨텍스트에서 4-니들 MRCR 변형에서 거의 100% 정확도를 달성하여, 깊은 문서 분석에서 GPT-5.1보다 substantially 더 정확합니다.
시각 기능도 다음과 같이 향상되었습니다:
- 오류 감소: 차트 추론 및 소프트웨어 인터페이스 이해 오류율이 약 절반으로 감소했습니다.
- 공간 인식: 모델은 이미지 내 상대적 레이아웃 및 요소 위치에 대한 이해가 향상되었으며, 예를 들어 마더보드上的 구성 요소를 식별할 수 있습니다.
- 인터페이스 이해: ScreenSpot-Pro에서 GPT-5.2 Thinking은 Python이 활성화된 상태에서 86.3%를 기록했으며, 이는 GPT-5.1 Thinking의 64.2%보다 높습니다.
수학, 과학 및 추론
GPT-5.2 Pro와 Thinking은 과학적 가속을 선도하는 모델로 자리매김했습니다:
- GPQA Diamond: GPT-5.2 Pro는 이 대학원 수준 과학 벤치마크에서 93.2%, GPT-5.2 Thinking은 92.4%를 달성했습니다.
- FrontierMath: GPT-5.2 Thinking은 Tier 1–3 작업에서 새로운 최첨단 상태를 확립하여 문제의 40.3%를 해결했습니다.
- 경진대회 수학: Pro와 Thinking 버전 모두 AIME 2025에서 100%를 달성했습니다.
- ARC-AGI: GPT-5.2 Pro는 ARC-AGI-1 (검증됨)에서 90% 임계값을 처음으로 넘어섰으며 90.5%를 기록했습니다. 더 어려운 ARC-AGI-2 (검증됨)에서 GPT-5.2 Pro는 54.2%를 달성했습니다.
도구 호출 및 사실성
GPT-5.2 Thinking은 Tau2-bench Telecom에서 98.7%를 달성하여 멀티턴 도구 사용에서의 높은 신뢰성을 입증했습니다. 또한 reasoning.effort='none'이 설정된 지연 민감한 경우에서 GPT-5.1과 GPT-4.1보다 추론 성능이 뛰어납니다.
사실성과 관련하여, 최대 추론 노력과 검색 도구를 사용할 때 GPT-5.2 Thinking의 오류가 포함된 응답은 GPT-5.1 Thinking에 비해 상대적으로 30% 적게 발생했습니다.
모델 변형 및 가용성
OpenAI는 다양한 사용자 요구에 맞춰 세 가지 distinct 버전의 모델을 배포했습니다:
| 모델 | 주요 사용 사례 | 주요 특징 |
|---|---|---|
| GPT-5.2 Instant | 일상 업무, 학습, 번역 | 빠르고 대화식이며 명확한 설명 |
| GPT-5.2 Thinking | 복잡한 코딩, 장문 문서 합성, 수학 | 깊은 추론과 세련된 출력 |
| GPT-5.2 Pro | 고난이도 질문 및 프로그래밍 | 가장 똑똑하고 신뢰할 수 있으며 높은 latency |
API 가격 및 접근성
GPT-5.2는 Responses API 및 Chat Completions API를 통해 이용할 수 있습니다.
- 이름:
gpt-5.2(Thinking),gpt-5.2-chat-latest(Instant), 그리고gpt-5.2-pro(Pro). - 가격: 입력 토큰 1M당 $1.75, 출력 토큰 1M당 $14 (캐시된 입력에 대해 90% 할인 적용).
- 추론 노력: Pro 및 Thinking 모델은 이제 다섯 번째 추론 effort 수준인
xhigh를 지원합니다.
안전 및 콘텐츠 보호
GPT-5.2는 도움이 되고 안전 경계를 균형 있게 유지하기 위해 '안전 완료' 연구를 구현합니다. 정신 건강 고통, 자해, 감정적 의존과 관련된 응답에 개선이 이루어졌습니다.
또한 OpenAI는 18세 미만 사용자를 위한 콘텐츠 보호를 자동으로 적용하기 위해 나이 예측 모델을 도입하고 있습니다. 정신 건강 평가에서 GPT-5.2 Thinking은 자해 항목에서 0.963, 정신 건강 벤치마크에서 0.915를 기록했으며, 이는 GPT-5.1 Thinking의 0.684보다 높은 점수입니다.
Sources
- OriginalIntroducing GPT-5.2