GPT-5.3-Codex 릴리스 노트 / 새로운 기능

OpenAI는 GPT-5.3-Codex를 소개합니다. 이 모델은 연구, 도구 사용 및 복잡한 실행을 포함하는 장기 작업을 처리하도록 설계된 고성능 에이전시 코딩 모델입니다. GPT-5.3-Codex는 GPT-5.2-Codex의 최첨단 코딩 성능과 GPT-5.2의 추론 및 전문 지식을 결합했으며, 이전 모델보다 25% 더 빠르게 동작합니다.

최첨단 에이전시 기능

GPT-5.3-Codex는 코딩 및 컴퓨터 사용 작업에서 새로운 산업 벤치마크를 설정하며, 단순 코드 생성에서 벗어나 자율 실행까지 확장됩니다.

소프트웨어 엔지니어링 및 터미널 스킬

GPT-5.3-Codex는 실제 소프트웨어 엔지니어링을 다루는 다중 언어 평가인 SWE‑Bench Pro에서 최첨단 성능을 달성했으며, Terminal‑Bench 2.0에서도 이전 성능을 크게 능가합니다. 특히, 모델은 이전 모델보다 적은 토큰으로 이러한 결과를 얻어 사용자 효율성을 높였습니다.

웹 개발 및 반복 설계

이 모델은 복잡하고 기능적인 게임 및 애플리케이션을 처음부터 구축하는 고급 능력을 보여줍니다. 내부 테스트에서 GPT-5.3-Codex는 "버그 수정" 또는 "게임 개선"과 같은 일반적인 후속 프롬프트를 사용해 수백만 토큰에 걸쳐 레이싱 게임과 다이빙 게임을 자율적으로 반복했습니다.

또한, 일상적인 웹사이트 제작에 대한 의도 이해도가 향상되었습니다. 예를 들어, "Quiet KPI"의 랜딩 페이지를 만들라는 프롬프트에 대해 GPT-5.3-Codex는 연간 플랜에 대한 할인 월간 가격 및 전환되는 고객 후기 캐러셀과 같은 프로덕션 수준 기능을 자동으로 구현했으며, 이는 GPT-5.2-Codex에서는 누락되었습니다.

일반 전문 지식 작업

GPT-5.3-Codex는 디버깅, 배포, 모니터링, PRD 작성, 사용자 조사 등 전체 소프트웨어 수명 주기를 지원합니다. 또한, GDPval 벤치마크에서 GPT-5.2와 동등한 성능을 보여주며, 이 벤치마크는 스프레드시트와 프레젠테이션 작성 등 44개의 다양한 직업에 대한 성과를 측정합니다.

컴퓨터 사용 능력 측면에서 GPT-5.3-Codex는 시각 정보를 활용해 시각적 데스크톱 환경에서 생산성 작업을 수행하는 OSWorld‑Verified 벤치마크에서 성능이 크게 향상되었습니다.

자체 개선 개발 사이클

GPT-5.3-Codex는 자체 제작에 직접 활용된 최초의 OpenAI 모델입니다. Codex 팀은 모델의 초기 버전을 사용해:

  • 자체 학습 실행을 디버깅하고 학습 중 패턴을 추적했습니다.
  • 배포를 관리하고 테스트 결과를 진단했습니다.
  • GPT-5.3-Codex용 하네스를 최적화하고 컨텍스트 렌더링 버그를 식별했습니다.
  • 트래픽 급증에 대응해 GPU 클러스터를 동적으로 확장하고 지연 시간 안정성을 유지했습니다.
  • 정규식 분류기를 활용해 알파 테스트 로그를 분석하고 생산성 및 사용자 응답 빈도를 추정했습니다.

인터랙티브 협업 및 스티어링

모델 능력과 인간 감독 사이의 격차를 줄이기 위해, GPT-5.3-Codex는 Codex 앱 내에서 보다 인터랙티브하게 동작합니다. 사용자는 이제 모델이 작업을 수행하는 동안 실시간으로 질문하고 접근 방식을 논의하며 모델을 "스티어링"할 수 있습니다. 이 "스티어링" 기능은 앱 설정의 General > Follow‑up behavior에서 활성화할 수 있습니다.

사이버 보안 및 안전 프레임워크

GPT-5.3-Codex는 OpenAI의 Preparedness Framework에서 사이버 보안 작업에 대해 "고성능"으로 분류된 최초의 모델이며, 소프트웨어 취약점을 식별하도록 직접 교육받은 첫 모델입니다.

안전 완화 조치

사이버 보안 능력의 이중 사용 가능성을 고려해 OpenAI는 다음과 같은 포괄적인 안전 스택을 구현했습니다:

  • 안전 교육 및 자동 모니터링.
  • 고급 기능에 대한 신뢰 접근.
  • 위협 인텔리전스를 활용한 집행 파이프라인.
  • 오용 방지를 위해 GPT-5.3-Codex의 고위험 사이버 요청을 GPT-5.2로 자동 라우팅.

생태계 지원

OpenAI는 방위 연구를 위한 파일럿 프로그램인 "Trusted Access for Cyber"를 시작합니다. 또한 보안 연구 에이전트인 Aardvark의 프라이빗 베타를 확대하고, Next.js와 같은 주요 오픈소스 프로젝트에 대한 무료 코드베이스 스캔을 제공하고 있습니다. 사이버 방어를 더욱 지원하기 위해 OpenAI는 오픈소스 소프트웨어 및 핵심 인프라를 위한 사이버 보안 보조금 프로그램에 1,000만 달러 규모의 API 크레딧을 약속했습니다.

기술 사양 및 제공 여부

  • Performance: 인프라 및 추론 스택 개선으로 이전 버전보다 25% 빠름.
  • Hardware: NVIDIA GB200 NVL72 시스템에서 공동 설계, 학습 및 서비스 제공.
  • Availability: 유료 ChatGPT 플랜을 통해 Codex 앱, CLI, IDE 확장 및 웹에서 이용 가능. API 접근은 향후 릴리스 예정.

성능 벤치마크

벤치마크 GPT-5.3-Codex GPT-5.2-Codex GPT-5.2
SWE-Bench Pro (Public) 56.8% 56.4% 55.6%
Terminal-Bench 2.0 77.3% 64.0% 62.2%
OSWorld-Verified 64.7% 38.2% 37.9%
GDPval (wins or ties) 70.9% - 70.9% (high)
Cybersecurity CTF Challenges 77.6% 67.4% 67.7%
SWE-Lancer IC Diamond 81.4% 76.0% 74.6%

Sources