GPT-5.3-Codex-Spark 릴리스 노트
OpenAI는 실시간 인터랙티브 코딩을 위해 특별히 설계된 GPT-5.3-Codex의 소규모 버전인 GPT-5.3-Codex-Spark의 연구 프리뷰를 출시했습니다. Cerebras와의 파트너십을 활용해 모델은 초당 1,000 토큰 이상을 제공하며, 개발자가 목표 지향적인 편집을 수행하고 거의 즉각적인 피드백으로 로직을 재구성할 수 있게 합니다.
실시간 코딩 기능
GPT-5.3-Codex-Spark는 지연 시간이 지능만큼 중요한 인터랙티브 워크플로에 최적화되었습니다. 자율적이고 장시간 실행되는 작업을 위해 설계된 대형 모델과 달리 Codex-Spark는 가벼운 작업 방식을 위해 조정되어 최소한의 목표 편집에 집중하고 명시적으로 요청되지 않는 한 자동 테스트 실행을 피합니다. 이를 통해 개발자는 모델을 실시간으로 중단하거나 재지시하여 인터페이스와 로직을 빠르게 반복할 수 있습니다.
성능 및 벤치마크
규모가 작음에도 불구하고 Codex-Spark는 실제 소프트웨어 엔지니어링 작업에 높은 역량을 유지합니다. 에이전트형 소프트웨어 엔지니어링을 평가하는 SWE-Bench Pro와 Terminal-Bench 2.0 벤치마크에서 모델은 전체 GPT-5.3-Codex 모델이 소요하는 시간의 일부만으로 작업을 완료하면서 강력한 성능을 보여줍니다.
인프라 및 지연 최적화
실시간 협업을 지원하기 위해 OpenAI는 전체 요청‑응답 파이프라인에 걸쳐 종단 간 지연 개선을 구현했습니다. 이러한 최적화는 모든 모델에 혜택을 주며 다음을 포함합니다:
- Pipeline Streamlining: 재작성된 추론 스택과 최적화된 세션 초기화로 첫 토큰 도달 시간을 50% 단축했습니다.
- Network Efficiency: 지속적인 WebSocket 연결 도입 및 Responses API 최적화를 통해 클라이언트/서버 왕복 오버헤드를 80%, 토큰당 오버헤드를 30% 감소시켰습니다.
Cerebras와의 하드웨어 통합
GPT-5.3-Codex-Spark는 고속 추론을 위해 설계된 전용 AI 가속기인 Cerebras Wafer Scale Engine 3에 의해 구동됩니다. GPU가 비용 효율적인 광범위 사용의 주요 기반을 유지하는 반면, Cerebras 하드웨어는 지연 시간 우선 서빙 계층을 제공하여 GPU를 보완하고 개발자의 반복 루프를 더욱 긴밀하게 만듭니다.
"GPT-5.3-Codex-Spark에 대해 가장 흥미로운 점은 OpenAI와 개발자 커뮤니티가 협력해 빠른 추론이 가능하게 하는 새로운 상호작용 패턴, 새로운 사용 사례, 그리고 근본적으로 다른 모델 경험을 발견하는 것입니다."
— Sean Lie, CTO 및 Co-Founder of Cerebras
가용성 및 기술 사양
Codex-Spark는 현재 Codex 앱, CLI, VS Code 확장을 통해 ChatGPT Pro 사용자에게 연구 프리뷰 형태로 제공되고 있습니다. 또한 소수의 디자인 파트너에게 API 형태로도 제공됩니다.
기술 사양:
- Context Window: 128k tokens.
- Modality: Text-only.
- Safety: 모델은 표준 배포 평가를 거쳤으며 사이버 보안 또는 생물학 분야에서 고역량을 위한 Preparedness Framework 기준을 충족하지 못합니다.
향후 로드맵
OpenAI는 Codex-Spark가 초고속 모델군의 첫 번째 제품이 되기를 목표로 하고 있습니다. 장기 목표는 장기 추론 및 실행과 실시간 협업을 결합한 하이브리드 Codex 경험을 제공하는 것입니다. 이를 통해 사용자는 인터랙티브 루프를 유지하면서 복잡한 백그라운드 작업을 서브 에이전트에 위임하거나 여러 모델에 작업을 병렬로 분산시킬 수 있습니다.
Sources
- OriginalIntroducing GPT-5.3-Codex-Spark