OpenAI GPT-5.4 출시: 통합 추론, 코딩 및 컴퓨터 사용 모델, 1M 토큰 컨텍스트
TL;DR
OpenAI는 GPT‑5.4를 출시했으며, 이는 전문 작업을 위한 가장 강력하고 효율적인 최첨단 모델이며, 이제 ChatGPT(Thinking 로), API 및 Codex에서 사용할 수 있고, 고성능 Pro 변형도 제공됩니다. 이 모델은 네이티브 컴퓨터 사용, 최대 1 M 토큰 컨텍스트, 향상된 도구 검색, 그리고 더 강력한 추론, 코딩 및 지식 작업 능력을 추가하여 다양한 벤치마크에서 높은 정확도, 낮은 토큰 사용량 및 빠른 속도를 제공합니다.
출시 개요
OpenAI는 2026년 3월 5일에 GPT‑5.4 출시를 발표했습니다. 이 모델은 세 가지 제품 라인에 배포됩니다:
- ChatGPT – GPT‑5.4 Thinking (표준) 및 GPT‑5.4 Pro (최대 성능)으로 제공됩니다.
- API –
gpt-5.4및gpt-5.4-pro엔드포인트를 통해 접근할 수 있습니다. - Codex – 새로운 코딩 중심 기능과 통합되었습니다.
GPT‑5.4는 최근의 추론, 코딩 및 에이전트 워크플로우의 발전을 통합하여, GPT‑5.3‑Codex의 코딩 강점을 이어받고 스프레드시트, 프레젠테이션, 문서 및 도구가 풍부한 환경에서 성능을 확장합니다.
주요 기술 개선 사항
통합 추론 및 계획
- 사전 계획 – ChatGPT에서 모델은 이제 응답을 생성하기 전에 사고 과정을 개요로 제시하여 사용자가 중간에 계획을 조정할 수 있습니다.
- 긴 컨텍스트 – 최대 1 M 토큰을 지원하여 에이전트가 매우 긴 작업에서도 일관성을 유지할 수 있습니다.
- 토큰 소비 감소 – 유사한 추론에 대해 GPT‑5.2보다 훨씬 적은 토큰을 사용하여 비용과 지연 시간을 낮춥니다.
네이티브 컴퓨터 사용
- 최초의 범용 모델로, 내장된 컴퓨터 사용 기능을 제공하여 에이전트가 Playwright와 같은 라이브러리를 통해 애플리케이션을 제어하고 스크린샷에서 마우스/키보드 동작을 수행할 수 있습니다.
- 도구 검색 – 모든 도구 정의를 미리 로드하는 대신, 모델은 필요에 따라 도구 정의를 가져와 대규모 도구 중심 워크플로우에서 토큰 사용량을 ≈47 % 절감합니다.
- 도구 호출 정확도 – Toolathlon 및 τ2‑bench와 같은 벤치마크에서 다단계 도구 사용을 개선하여 더 적은 상호작용 턴으로 높은 정확도를 달성합니다.
비전 및 인식
original이미지 디테일 레벨(최대 10.24 M 픽셀)을 도입하고high레벨을 2.56 M 픽셀로 확장하여 위치 파악, 클릭 정확도 및 밀집 이미지 이해를 향상시킵니다.- 도구 없이 MMMU‑Pro에서 81.2 %, 도구와 함께 **82.1 %**를 달성하여 GPT‑5.2를 능가합니다.
코딩 향상
- GPT‑5.3‑Codex의 코딩 강점을 새로운 추론 및 도구 기능과 결합합니다.
- Codex의 /fast mode는 지능을 희생하지 않으면서 토큰 처리 속도를 최대 1.5× 빠르게 합니다.
- 웹/Electron 앱의 시각적 디버깅 및 자동 테스트를 위한 실험적 Playwright (Interactive) 스킬을 도입했습니다.
벤치마크 성능
| 벤치마크 | GPT‑5.4 | GPT‑5.3‑Codex | GPT‑5.2 |
|---|---|---|---|
| GDPval (knowledge work) | 83.0 % | – | 70.9 % |
| SWE‑Bench Pro (coding) | 57.7 % | – | 55.6 % |
| OSWorld‑Verified (desktop computer use) | 75.0 % | 74.0 % | 47.3 % |
| WebArena‑Verified (browser use) | 67.3 % | – | 65.4 % |
| BrowseComp (web search) | 82.7 % (standard) / 89.3 % (Pro) | 77.3 % | 65.8 % |
| MMMU‑Pro (vision) | 81.2 % (no tools) / 82.1 % (with tools) | – | 79.5 % |
| Toolathlon (tool use) | 54.6 % | – | 45.7 % |
| Investment‑banking spreadsheet task (internal) | 87.3 % | – | 68.4 % |
| Presentation quality (human raters) | 68.0 % preferred over GPT‑5.2 |
모든 평가에서는 별도 언급이 없는 한 추론 노력을 xhigh 로 설정하여 실행되었습니다.
실제 적용 가능성
전문 지식 작업
- 44개 직종에 걸친 GDPval 비교에서 **83 %**에 해당하거나 이를 초과하여 산업 전문가와 동등하거나 뛰어납니다.
- 사실 오류를 감소시킵니다: 개별 주장에 대한 오류 가능성이 33 % 낮으며, 전체 응답에 오류가 포함될 가능성이 GPT‑5.2 대비 18 % 낮습니다.
- 더 높은 품질의 스프레드시트, 프레젠테이션 및 문서를 생성하며, 인간 평가자는 미학 및 기능 다양성 측면에서 GPT‑5.4 출력을 선호합니다.
컴퓨터 사용 에이전트
- 데스크톱 탐색에서 (75 % vs. GPT‑5.2의 47 %) 최신 성공률을 달성하고, 웹 상호작용 벤치마크에서는 (Online‑Mind2Web에서 최대 92.8 %) 높은 성과를 보입니다.
- 도구 검색 및 병렬 도구 활용 덕분에 지연 시간이 감소한 협조적인 다중 도구 워크플로우를 지원합니다.
- 재산세 포털 작업에서 95 %의 첫 시도 성공률을 보였으며, 세션을 ~3× 빠르게 완료하고 토큰 사용량을 ~70 % 줄였습니다.
코딩 및 개발
- SWE‑Bench Pro에서 GPT‑5.3‑Codex보다 뛰어난 성능을 보이며 지연 시간이 낮습니다.
- Playwright (Interactive) 스킬은 코드 생성 중 시각적 디버깅 및 자동 테스트를 가능하게 하며, 단일 프롬프트로 구축된 전체 테마파크 시뮬레이션으로 예시됩니다.
안전 및 거버넌스
- OpenAI의 대비 프레임워크에서 고급 사이버 역량으로 분류되며, 모니터링 확대, 신뢰된 접근 제어, Zero Data Retention (ZDR) 환경에서 고위험 요청에 대한 비동기 차단을 포함합니다.
- 오픈소스 CoT controllability 평가를 도입하여 GPT‑5.4가 사고 흐름을 숨기는 능력이 낮음을 보여주며, CoT 모니터링의 효과성을 강화합니다.
- 지속적인 개선 과정에서 분류기가 향상됨에 따라 ZDR 고객에게 가끔씩 오탐 거부가 발생할 수 있습니다.
가용성 및 가격
- ChatGPT – GPT‑5.4 Thinking은 Plus, Team, Pro 사용자에게 제공되며, GPT‑5.4 Pro는 Pro 및 Enterprise 플랜에서 이용 가능합니다. 기존 GPT‑5.2 Thinking은 2026년 6월 5일까지 유지됩니다.
- API –
gpt-5.4(표준) 및gpt-5.4-pro(최대 성능)이 제공됩니다. 토큰당 가격: 입력 $2.50, 캐시 입력 $0.25, 출력 $15 (표준); Pro 변형은 입력 $30, 출력 $180. - 컨텍스트 창 – 기본 272 K 토큰; 실험적인 1 M 토큰 창은
model_context_window및model_auto_compact_token_limit을 통해 활성화할 수 있으며, 272 K 초과 사용에 대해 정상 요금의 2배가 청구됩니다.
개발자 및 기업에 대한 시사점
- 생산성 향상 – 모델의 계획, 긴 컨텍스트 및 효율적인 도구 사용은 복잡한 작업에 필요한 상호작용 턴 수를 감소시킵니다.
- 비용 효율성 – 토큰당 요금이 높음에도 전체 토큰 소비량이 감소합니다. 이는 GPT‑5.4가 더 적은 토큰으로 문제를 해결하기 때문입니다.
- 광범위한 도구 생태계 – 도구 검색을 통해 에이전트가 수천 개의 도구를 사용하면서도 과도한 토큰 비용을 발생시키지 않습니다.
- 신뢰성 강화 – 환각률 감소와 강화된 안전 제어 덕분에 GPT‑5.4는 법률 분석, 재무 모델링, 의료 일정 관리 등 고위험 전문 분야에 적합합니다.
결론
OpenAI의 GPT‑5.4는 최첨단 AI에서 중요한 도약을 의미하며, 최신 추론, 코딩, 비전 및 네이티브 컴퓨터 사용을 하나의 모델에 결합했습니다. 전문 작업, 코딩 및 컴퓨터 사용 벤치마크 전반에 걸친 성능 향상과 토큰 효율성 및 안전 기능의 개선으로 복잡하고 실제적인 워크플로우에 고품질·비용 효율적인 AI 지원을 원하는 기업 및 개발자에게 매력적인 선택이 됩니다.
출처
- OpenAI 블로그 게시물 – Introducing GPT‑5.4 (2026‑03‑05) – https://openai.com/index/introducing-gpt-5-4
Sources
- OriginalIntroducing GPT-5.4