OpenAI GPT‑Live: 실시간 음성 AI 시스템 설계
OpenAI는 전통적인 턴 기반 음성 AI의 느림을 없애기 위해 설계된 3세대 음성 시스템인 GPT‑Live를 개발했습니다. 턴 감지기를 전체 이중(풀 듀플렉스) 음성 모델로 교체해 동시에 듣고 말할 수 있게 함으로써, GPT‑Live는 1초 미만의 응답 속도와 보다 자연스러운 대화 리듬을 구현합니다.
턴 기반에서 스트리밍 아키텍처로 전환
GPT‑Live는 음성‑텍스트, LLM, 텍스트‑음성 변환이 순차적으로 실행되던 연쇄 시스템과, 여전히 턴 감지기에 의존해 추론을 트리거하던 기존 음성‑음성 모델에서 벗어났습니다.
새로운 아키텍처에서는 음성 모델이 대화를 직접 제어합니다. 오디오는 모델 안팎으로 지속적으로 흐르고, 보다 깊은 추론과 도구 사용은 비동기적으로 처리됩니다. 이를 통해 주요 미디어 루프가 중단되지 않으며, "말하기"와 "생각하기"가 분리됩니다.
지속적인 추론과 저지연을 위한 엔지니어링
원활한 미디어 루프를 유지하고 청각적 아티팩트를 방지하기 위해 OpenAI는 여러 시스템 최적화를 적용했습니다:
전용 미디어 경로와 언어 전환
OpenAI는 미디어 흐름을 애플리케이션 및 비즈니스 로직과 분리했습니다. 오디오는 전용 고속 경로를 통해 이동하고, 위임 및 도구 사용은 비동기 RPC 경계 뒤에서 이루어집니다. 프레임 전달의 부드러움을 높이기 위해 미디어 프런트엔드와 추론 로직을 Go로 다시 작성했으며, 이전의 Python asyncio 구현을 대체했습니다. 이 변경으로 p95 지연 시간이 이전 시스템의 p50 수준에 맞춰졌습니다.
전송 및 프로토콜 최적화
WebRTC가 전송 기반으로 사용되어 패킷 손실 및 시계 드리프트를 처리합니다. 시작 지연을 더욱 줄이기 위해 OpenAI는 두 가지 핵심 혁신을 도입했습니다:
- WARP: 전송 핸드셰이크를 압축하고 네트워크 왕복 횟수를 감소시키도록 설계된 일련의 공개 사양.
- Instant Connect: SDP 파라미터를 사전에 협상하여 단일 UDP 패킷으로 세션을 시작할 수 있게 하는 메커니즘.
상태 기반 추론 및 컨텍스트 관리
장시간 대화를 중단 없이 지원하기 위해 OpenAI는 원활한 핸드오프 메커니즘을 개발했습니다. 모델 인스턴스를 교체하거나 컨텍스트를 압축해야 할 때(모델 제한에 맞추기 위해) 시스템은 교체 인스턴스를 병렬로 예열하고 필요한 컨텍스트를 미리 채운 뒤, 새 인스턴스가 준비되면 전환합니다. 이를 통해 KV 캐시 재구축으로 인한 청각적 지연을 방지합니다.
최전선 모델에 대한 비동기 위임
GPT‑Live는 복잡한 추론 및 검색을 위해 GPT‑5.5와 같은 최전선 모델과 통합되며, 실시간 음성 경로를 차단하지 않습니다.
위임 루프 최적화
위임된 결과가 충분히 빠르게 반환되어 유용하도록, OpenAI는 라우팅, 프롬프트 처리, 추론, 도구 호출 전체 루프를 최적화합니다. 여기에는 최전선 모델을 위한 추론 세션을 생성하고, 음성 세션이 시작되자마자 대화 컨텍스트를 미리 채워 넣는 작업이 포함되며, 안정적인 세션 친화성과 프롬프트 캐싱을 활용해 지연 시간을 최소화합니다.
연속 음성에서 이산 턴 도출
주변 시스템(예: UI 및 안전 인프라)에서는 이산 메시지가 필요하기 때문에, 애플리케이션 서버는 부분 전사와 타이밍 신호를 사용해 화자 턴을 추론합니다. 시스템은 UI를 위한 추측적 뷰와 분석을 위한 권위 있는 기록을 유지해, 음성 경로는 연속성을 유지하면서 교환 기록은 안정적으로 제공합니다.
프로덕션 테스트 및 확장
OpenAI는 "silent tests"를 통해 GPT‑Live를 검증했으며, 프로덕션 ChatGPT Voice 세션의 일부를 읽기 전용 모드로 새로운 시스템에 라우팅했습니다. 이 과정에서 여러 중요한 인사이트가 도출되었습니다:
- 용량 계획: 용량은 동시 세션 수와 모든 프레임을 일정에 맞게 유지할 수 있는 능력에 의해 결정되며, 단순히 GPU 처리량만으로는 판단할 수 없습니다.
- 지리적 분산: 엔드‑투‑엔드 응답성은 세션을 지역 용량에 라우팅해 거리 기반 지연을 최소화하는 것에 크게 좌우됩니다.
- 수명 주기 실패: 장시간 세션 및 재연결은 짧은 부하 테스트에서는 드러나지 않았던 메모리 압박 및 상태 복원 문제를 드러냈습니다.
이 아키텍처는 현재 데스크톱 앱에서 컴퓨터 제어 및 에이전트 조정을 포함한 ChatGPT Voice 기능을 구동하고 있으며, 향후 GPT‑Live API의 기반이 될 것입니다.