OpenAI GPT-5.5 릴리스 노트
OpenAI는 GPT-5.5와 GPT-5.5 Pro를 출시했으며, 다양한 소프트웨어 도구를 활용해 다중 파트 작업을 계획하고 실행할 수 있는 에이전트형 AI로의 전환을 의미합니다. 이 모델들은 GPT-5.4에 비해 토큰당 지연 시간을 증가시키지 않으면서 코딩 및 지식 작업에서 더 높은 지능과 향상된 토큰 효율성을 제공합니다.
에이전트 코딩 및 소프트웨어 엔지니어링
GPT-5.5는 복잡하고 장기적인 엔지니어링 작업을 관리할 수 있는 고자율 코딩 모델로 설계되었습니다. 시스템 아키텍처를 이해하고, 모호한 오류를 추론하며, 대규모 코드베이스 전반에 걸쳐 컨텍스트를 유지하는 능력이 강화되었습니다.
성능 벤치마크
- Terminal-Bench 2.0: 복잡한 명령줄 워크플로에서 82.7% 정확도를 달성했습니다.
- SWE-Bench Pro: 실제 GitHub 이슈 해결에서 58.6%에 도달했습니다.
- Expert-SWE (Internal): 인간 평균 완료 시간이 20시간인 작업에서 GPT-5.4를 능가했습니다.
실제 적용 사례
초기 테스트 사용자들은 개념적 명확성에서 큰 변화를 보고했습니다. 예를 들어, 모델은 수백 개의 프론트엔드 및 리팩터링 변경을 포함한 복잡한 브랜치 병합을 20분 만에 성공적으로 수행했습니다. NVIDIA와 Cursor의 사용자들은 명시적 프롬프트 없이도 테스트 및 리뷰 요구를 예측하고 지속성을 보여준다고 언급했습니다.
지식 작업 및 컴퓨터 사용
GPT-5.5는 의도 이해와 컴퓨터 사용 기능을 더욱 통합하여 인터페이스를 탐색하고, 클릭하고, 입력하며, 도구 간 이동을 통해 지식 작업 루프를 완성할 수 있습니다.
전문 벤치마크
- GDPval: 44개 직종에 걸쳐 잘 정의된 지식 작업을 수행하는 데 84.9% 점수를 기록했습니다.
- OSWorld-Verified: 실제 컴퓨터 환경을 자율적으로 운영하는 데 78.7%에 도달했습니다.
- Tau2-bench Telecom: 프롬프트 튜닝 없이 복잡한 고객 서비스 워크플로에서 98.0%를 달성했습니다.
내부 배포
OpenAI는 직원의 85% 이상이 매주 Codex를 사용한다고 보고했습니다. 사용 사례로는 재무 팀이 71,000페이지 이상의 K-1 세금 양식을 검토하여 작업 시간을 두 주 단축한 것과 커뮤니케이션 팀이 Slack 에이전트를 통해 저위험 발언 요청을 자동화한 것이 포함됩니다.
과학 연구 및 수학적 발견
GPT-5.5는 "공동 과학자" 역할을 수행하며 아이디어 탐색, 증거 수집, 결과 해석의 반복 루프를 지속합니다.
기술 성과
- Mathematical Proof: 내부 버전의 GPT-5.5가 조합론에서 비대각 라므시 수에 대한 새로운 증명을 발견했으며, 이후 Lean에서 검증되었습니다.
- Bioinformatics: 모델은 BixBench에서 최고 성능을 달성했으며, GeneBench에서 GPT-5.4에 비해 크게 향상되었으며, 특히 유전학의 다단계 과학 데이터 분석에서 두드러졌습니다.
- Custom Tooling: 연구자들은 모델을 사용해 단일 프롬프트만으로 복잡한 대수기하학 애플리케이션을 몇 분 안에 구축하고, 이차 곡면 교차점을 시각화했습니다.
추론 효율성 및 인프라
GPT-5.5는 NVIDIA GB200 및 GB300 NVL72 시스템에서 공동 설계 및 학습되었습니다. GPT-5.4와 동일한 지연 수준을 유지하기 위해 OpenAI는 모델 자체를 활용해 추론 스택을 최적화했습니다.
Codex를 사용해 프로덕션 트래픽 패턴을 분석하고 로드 밸런싱 및 파티셔닝을 위한 맞춤형 휴리스틱 알고리즘을 작성했습니다. 이 최적화로 토큰 생성 속도가 20% 이상 향상되었습니다.
사이버 보안 및 안전 프레임워크
OpenAI는 준비성 프레임워크에서 GPT-5.5의 생물학, 화학, 사이버 보안 능력을 "높음"으로 분류했지만, 사이버 보안에 대해서는 "중요" 수준에 도달하지 못했습니다.
안전 조치
- Stricter Classifiers: 배포 시 고위험 활동 및 민감한 사이버 요청에 대한 더 엄격한 제어가 포함됩니다.
- Trusted Access for Cyber: 핵심 인프라를 방어하는 검증된 사용자와 조직은 합법적인 방어 작업의 마찰을 줄이기 위해 "사이버 허용" 모델(예: GPT-5.4-Cyber)을 신청할 수 있습니다.
- Governance: 모델은 레드팀 활동 및 고급 생물학·사이버 보안을 위한 목표 테스트를 포함한 전체 안전 처리 과정을 거쳤습니다.
가용성 및 가격
접근
- ChatGPT: GPT-5.5는 Plus, Pro, Business, Enterprise 사용자에게 제공됩니다. GPT-5.5 Pro는 Pro, Business, Enterprise 사용자에게 제공됩니다.
- Codex: 400K 컨텍스트 윈도우를 갖춘 Plus, Pro, Business, Enterprise, Edu, Go 플랜에서 이용 가능합니다.
- API: GPT-5.5와 GPT-5.5 Pro는 API를 통해 제공됩니다(2026년 4월 24일 기준).
API 가격
| 모델 | 입력 (1M 토큰당) | 출력 (1M 토큰당) | 컨텍스트 윈도우 |
|---|---|---|---|
| gpt-5.5 | $5 | $30 | 1M |
| gpt-5.5-pro | $30 | $180 | 1M |
배치 및 플렉스 가격은 표준 요금의 50%에 제공되며, 프리미엄 처리 비용은 표준 요금의 2.5배입니다.
Sources
- OriginalIntroducing GPT-5.5