GPT-5.1-Codex-Max 릴리스 노트
OpenAI는 장기 실행 및 복잡한 소프트웨어 엔지니어링 작업을 위한 프론티어 에이전틱 코딩 모델인 GPT-5.1-Codex-Max를 도입했습니다. 이 모델은 연구, 수학, 소프트웨어 엔지니어링 분야의 에이전틱 작업에 훈련된 업데이트된 기초 추론 모델을 기반으로 구축되어 보다 신뢰할 수 있는 코딩 파트너로 작동할 수 있게 합니다.
장거리 코딩을 위한 컴팩션
GPT-5.1-Codex-Max는 모델이 여러 컨텍스트 창에서 작동할 수 있게 하는 "컴팩션"이라는 네이티브 프로세스를 도입합니다. 장기 범위에서 중요한 컨텍스트를 보존하면서 기록을 정리함으로써, 모델은 단일 작업에서 수백만 개의 토큰을 일관되게 처리할 수 있습니다.
이 기능은 다음과 같이 가능하게 합니다:
- 프로젝트 규모 리팩터링: 이 모델은 진행 상황을 잃지 않고 코드베이스 전체에서 대규모 변경 사항을 처리할 수 있습니다.
- 심층 디버깅 세션: 복잡한 버그에 대한 지속적인 추론.
- 멀티시간 에이전트 루프: 내부 평가에서, 이 모델은 24시간 이상 작업을 독립적으로 수행하며 구현을 지속적으로 반복하고 테스트 실패를 수정했습니다.
Codex 애플리케이션에서, 모델은 컨텍스트 창 한계에 접근할 때 자동으로 세션을 컴팩션하여 작업을 완료할 때까지 새로운 창을 제공합니다.
기술 성능 및 토큰 효율성
GPT-5.1-Codex-Max는 이전 모델보다 토큰 효율성이 높고 더 빠릅니다. SWE-bench Verified 벤치마크에서, 이 모델은 "medium" 추론 노력만을 사용하면서 GPT-5.1-Codex보다 더 나은 성능을 보이며 사고 토큰을 30% 적게 소비합니다.
추론 노력 수준
- Medium: 대부분의 작업에 대한 일일 드라이버로 권장됩니다.
- Extra High (xhigh): 지연에 민감하지 않은 작업을 위한 새로운 설정으로, 모델이 더 오래 생각하여 더 높은 품질의 답을 얻을 수 있도록 합니다.
벤치마크 결과
| 벤치마크 | GPT-5.1-Codex (high) | GPT-5.1-Codex-Max (xhigh) |
|---|---|---|
| SWE-bench Verified (n=500) | 73.7% | 77.9% |
| SWE-Lancer IC SWE | 66.3% | 79.9% |
| Terminal-Bench 2.0 | 52.8% | 58.1% |
에이전틱 기능 및 환경 지원
GPT-5.1-Codex-Max는 PR 생성, 프론트엔드 코딩, 코드 리뷰 등을 포함한 실제 소프트웨어 엔지니어링 작업에 대해 훈련되었습니다. 이 모델은 Windows 환경에서 특별히 작동하도록 훈련된 시리즈 최초의 모델이며, Codex CLI 내에서 더 나은 협업을 위한 전문 훈련이 포함되어 있습니다.
보안 및 안전 프레임워크
GPT-5.1-Codex-Max는 현재까지 OpenAI가 배포한 가장 유능한 사이버 보안 모델이지만, OpenAI의 준비 프레임워크에서 'High' 능력에 도달하지는 않습니다. 위험을 완화하기 위해 OpenAI는 다음과 같은 조치를 시행했습니다:
- 보안 샌드박싱: Codex는 기본적으로 보안 샌드박스에서 실행되며, 작업 영역에 대한 파일 쓰기를 제한하고 개발자가 명시적으로 활성화하지 않는 한 네트워크 액세스를 비활성화합니다.
- 사이버 보안 모니터링: 악성 활동을 탐지하고 차단하기 위해 전용 모니터링이 사용되며, 의심스러운 활동은 정책 모니터링 시스템을 통해 라우팅됩니다.
- Human-in-the-Loop: 모델이 장기 작업을 수행할 수 있기 때문에, OpenAI는 프로덕션에 배포하기 전에 터미널 로그와 도구 호출 인용으로 지원되는 모든 에이전트 작업을 개발자가 검토할 것을 권장합니다.
가용성 및 통합
GPT-5.1-Codex-Max는 이제 Codex 표면에서 기본 모델이며, ChatGPT Plus, Pro, Business, Edu, Enterprise 플랜 사용자에게 제공됩니다. 이 모델은 일반적인 용도보다는 Codex 또는 유사한 환경에서의 에이전틱 코딩 작업에 특별히 권장됩니다.
API 키를 통해 Codex CLI를 사용하는 개발자에 대한 API 액세스는 곧 제공될 예정입니다.