OpenAI Responses API WebSocket 모드 출시
OpenAI는 에이전트 워크플로우를 가속화하기 위해 Responses API에 WebSocket 지원을 도입했습니다. 동기식 HTTP 호출을 지속적인 연결로 교체함으로써, OpenAI는 에이전트 루프의 종단 간 지연 시간을 최대 40%까지 줄였으며, 사용자는 GPT-5.3-Codex-Spark와 같은 모델의 고속 추론을 활용할 수 있게 되었습니다.
에이전트 워크플로우에서 API 병목 현상 해결
모델 추론 속도가 증가함에 따라, 요청 검증, 처리, 네트워크 홉과 같은 API 서비스의 오버헤드가 에이전트 루프의 주요 병목 현상이 됩니다. 에이전트 워크플로우에서는 모델이 행동을 결정하고, 도구를 실행하며, 결과를 처리하기 위해 수십 번의 왕복 요청을 수행할 수 있습니다.
이전에는 GPT-5 및 GPT-5.2와 같은 대표 모델이 초당 약 65 토큰(TPS) 수준으로 동작했습니다. 그러나 특수 Cerebras 하드웨어를 활용하는 GPT-5.3-Codex-Spark가 출시되면서 목표 속도는 1,000 TPS를 넘어섰습니다. 이러한 규모에서는 각 요청을 독립적으로 처리하면서—후속 요청마다 대화 상태와 히스토리를 재처리하는—누적 오버헤드가 구조적인 지연을 초래하여 GPU의 속도 향상을 무효화했습니다.
지연 시간 감소를 위한 기술 최적화
WebSocket을 구현하기 전에, OpenAI는 2025년 11월에 단일 요청에 대한 핵심 경로 지연 시간을 줄이기 위한 성능 스프린트를 수행했습니다. 이러한 최적화에는 다음이 포함되었습니다:
- Memory Caching: 렌더링된 토큰과 모델 구성을 캐시하여 다중 턴 응답에 대한 비용이 많이 드는 토큰화 및 네트워크 호출을 방지합니다.
- Network Hop Reduction: 중간 서비스 호출(예: 이미지 처리 해상도)을 제거하고 추론 서비스에 직접 호출합니다.
- Safety Stack Improvements: 분류기를 최적화하여 대화를 더 빠르게 플래그합니다.
이러한 변경으로 최초 토큰까지의 시간(TTFT)이 거의 45% 개선되었지만, 최신 코딩 모델의 1,000+ TPS 요구 사항을 충족하기에는 부족했습니다.
WebSocket 지속 연결 구현
중복 작업을 없애기 위해 OpenAI는 동기식 HTTP 요청에서 지속적인 WebSocket 연결로 전환했습니다. 이를 통해 API는 각 요청마다 대화 컨텍스트를 처음부터 재구성하는 대신, 연결 기간 동안 재사용 가능한 상태를 메모리에 캐시할 수 있습니다.
API 설계 및 상태 관리
OpenAI는 개발자 친화적인 경험을 유지하고 기존 입력 및 출력 형태를 유지하기 위해 gRPC 양방향 스트리밍보다 WebSocket을 선택했습니다. 최종 구현을 통해 개발자는 response.create와 previous_response_id 매개변수를 계속 사용할 수 있습니다.
WebSocket 연결을 통해 previous_response_id가 제공되면, 서버는 연결 범위의 인메모리 캐시에서 다음을 검색합니다:
- 이전
response객체. - 이전 입력 및 출력 항목.
- 도구 정의 및 네임스페이스.
- 이전에 렌더링된 토큰과 같은 재사용 가능한 샘플링 아티팩트.
결과적인 성능 향상
이 상태 재사용 아키텍처는 여러 구체적인 기술 효율성을 가능하게 합니다:
- Incremental Processing: 안전 분류기와 요청 검증기는 전체 히스토리가 아니라 새로운 입력만 처리합니다.
- Tokenization Efficiency: 렌더링된 토큰의 인메모리 캐시가 추가되어 불필요한 재토큰화를 건너뜁니다.
- Routing Optimization: 모델 해석 및 라우팅 로직이 요청 간에 재사용됩니다.
- Asynchronous Billing: 청구와 같은 비차단 사후 추론 작업이 이후 요청과 겹칠 수 있습니다.
프로덕션 영향 및 벤치마크
코딩 에이전트 스타트업과의 알파 기간을 거친 후, WebSocket 모드가 프로덕션에 배포되었습니다. 결과는 Responses API가 이제 초고속 추론 하드웨어와 보조를 맞출 수 있음을 보여줍니다:
- Throughput: GPT-5.3-Codex-Spark가 1,000 TPS 목표를 달성했으며, 버스트 시 최대 4,000 TPS에 도달했습니다.
- Vercel AI SDK: 지연 시간이 최대 40% 감소한 것으로 보고되었습니다.
- Cline: 다중 파일 워크플로우가 39% 빨라졌습니다.
- Cursor: OpenAI 모델이 최대 30% 빨라졌습니다.
- General Adoption: Codex는 대부분의 Responses API 트래픽을 WebSocket 모드로 전환했으며, GPT-5.3-Codex, GPT-5.4 및 최신 모델 사용자가 혜택을 받고 있습니다.