OpenAI GPT-5.1 릴리스 노트
OpenAI는 GPT-5.1을 출시했으며, 이 모델은 에이전시 및 코딩 워크플로우를 위해 고수준 지능과 실행 속도의 균형을 맞추도록 설계되었습니다. 이번 업데이트는 작업 복잡도에 따라 사고 시간을 조정하는 적응형 추론, 저지연 응답을 위한 전용 모드, 그리고 직접 코드 및 시스템 상호작용을 위한 새로운 개발자 도구를 도입합니다.
적응형 추론 및 효율성
GPT-5.1은 재구성된 학습 방식을 활용하여 요청의 복잡도에 따라 "생각"에 소요되는 시간과 토큰 양을 동적으로 조정할 수 있습니다. 이를 통해 복잡한 문제에 대한 신뢰성을 유지하면서도 간단한 작업에 대해 더 빠른 응답과 낮은 토큰 비용을 제공합니다.
성능 향상
- 지연 시간 감소: npm 명령 요청과 같은 간단한 질의에 대해 GPT-5.1은 응답 시간을 10초에서 2초로 줄일 수 있습니다.
- 제3자 검증: Balyasny Asset Management는 GPT-5.1이 GPT-5보다 2-3배 빠르게 실행되었으며, 도구 중심 추론 작업에서 주요 경쟁사보다 약 절반의 토큰을 사용했다고 보고했습니다. Pace는 그들의 에이전트가 GPT-5보다 정확도를 초과하면서도 50% 더 빠르게 실행되었다고 보고했습니다.
"No Reasoning" 모드
개발자는 reasoning_effort 매개변수를 none으로 설정하여 추론을 비활성화할 수 있습니다. 이 모드는 지연에 민감한 사용 사례에 최적화되어 있으며 GPT-5의 "minimal" 추론 설정에 비해 여러 장점을 제공합니다:
- 향상된 기능: 병렬 도구 호출, 코딩 작업, 명령 수행, 검색 도구 사용에서 더 나은 성능을 제공합니다.
- 웹 검색: API 플랫폼 내에서 웹 검색을 지원합니다.
- 실제 영향: Sierra는 GPT-5 최소 추론에 비해 저지연 도구 호출 성능이 20% 향상되었다고 관찰했습니다.
확장된 프롬프트 캐싱
지연 및 비용을 더욱 줄이기 위해 GPT-5.1은 최대 24시간(prompt_cache_retention='24h' 매개변수)까지 유지되는 확장된 프롬프트 캐싱을 지원합니다. 이는 이전 제한보다 크게 증가한 것으로, 보다 원활한 다중 턴 채팅 및 장기 코딩 세션을 가능하게 합니다. 캐시된 입력 토큰은 캐시되지 않은 토큰보다 90% 저렴합니다.
향상된 코딩 기능
GPT-5.1은 GPT-5에 비해 조정 가능성, 코드 품질, 도구 호출 중 사용자에게 표시되는 업데이트 메시지의 명확성을 개선했습니다. 특히 간단한 편집에서 "과도한 사고"를 줄이면서 복잡한 작업에서 높은 성능을 유지하도록 최적화되었습니다.
벤치마크 및 산업 피드백
- SWE-bench 검증: GPT-5.1은 76.3% 점수를 달성했으며, GPT-5의 72.8%를 능가했습니다.
- 개발자 도구: Cursor, Cognition, Augment Code, Factory, Warp 등 기업이 모델의 코딩 퍼스낼리티에 협업했습니다. Augment Code는 다중 파일 프로젝트에서 더 정확한 변경과 빠른 반복을 언급했으며, Cline은 그들의 diff 편집 벤치마크에서 7% 향상을 보고했습니다.
새로운 개발자 도구
Responses API에 두 가지 새로운 도구가 도입되어 보다 신뢰할 수 있는 에이전시 행동을 가능하게 합니다:
apply_patch 도구
이 도구는 모델이 구조화된 diff를 사용하여 파일을 생성, 업데이트 및 삭제할 수 있게 합니다. 단순히 편집을 제안하는 대신 패치 작업을 내보냄으로써, 모델은 JSON 이스케이프 없이도 보다 신뢰할 수 있는 반복적인 다단계 편집 워크플로를 가능하게 합니다.
Shell 도구
Shell 도구는 모델이 로컬 머신에서 실행될 명령줄 인터페이스(CLI) 명령을 제안할 수 있게 합니다. 이를 통해 모델이 시스템을 검사하고, 유틸리티를 실행하며, 데이터를 수집하여 작업을 완료하는 계획-실행 루프를 생성합니다.
모델 가용성 및 변형
GPT-5.1 및 gpt-5.1-chat-latest는 모든 유료 API 티어에서 개발자에게 제공되며, 가격 및 속도 제한은 GPT-5와 동일합니다. 또한 OpenAI는 gpt-5.1-codex와 gpt-5.1-codex-mini를 출시했으며, 이는 Codex와 유사한 환경에서 장기 에이전시 코딩 작업에 특화되어 최적화되었습니다.
기술 평가 요약
| 평가 | GPT-5.1 (high) | GPT-5 (high) |
|---|---|---|
| SWE-bench Verified | 76.3% | 72.8% |
| GPQA Diamond (no tools) | 88.1% | 85.7% |
| AIME 2025 (no tools) | 94.0% | 94.6% |
| FrontierMath (with Python) | 26.7% | 26.3% |
| MMMU | 85.4% | 84.2% |
| Tau 2-bench Airline | 67.0% | 62.6% |
| Tau 2-bench Telecom | 95.6% | 96.7% |
| Tau 2-bench Retail | 77.9% | 81.1% |
| BrowseComp Long Context 128k | 90.0% | 90.0% |
SUMMARY: OpenAI는 적응형 추론, 새로운 'no reasoning' 모드, 그리고 특화된 코딩 도구를 통해 지능과 속도 간의 균형을 최적화한 모델 GPT-5.1을 출시했습니다.
TITLE: OpenAI GPT-5.1 릴리스 노트