OpenAI GPT‑Live‑1 API 릴리스

TL;DR

OpenAI는 API에 GPT‑Live‑1을 발표했습니다. 이는 동시에 듣고 말할 수 있는 완전 이중 방식의 음성 모델로, 음성 기반 애플리케이션의 중단 처리, 지연 시간, 대화의 자연스러움을 크게 향상시킵니다.


GPT‑Live‑1이란?

GPT‑Live‑1은 하나의 통합 아키텍처에서 자동 음성 인식(ASR), 추론, 텍스트-to-음성(TTS)을 수행하는 단일 모델입니다. 이 모델은 처음 ChatGPT에서 시연되었으며, 이제 개발자들이 OpenAI API를 통해 이용할 수 있습니다.

주요 기능은 다음과 같습니다:

  • 동시 수신 및 발신 – 모델은 들어오는 음성 데이터를 처리하면서 동시에 나가는 음성 생성을 수행하여 별도의 STT‑LLM‑TTS 파이프라인을 필요로 하지 않습니다.
  • 부드러운 중단 처리 – 들어오는 음성과 나가는 음성을 함께 추론하여, 턴 기반 시스템 대비 중단을 최대 80% 감소시킵니다 (Speak의 초기 평가 기준).
  • 백엔드 모델로의 위임 – 깊이 있는 추론 및 도구 호출은 GPT‑6 Astra와 같은 텍스트 기반 모델이나 제3자 모델로 위임할 수 있습니다.
  • 사용자 정의 톤, 속도, 스타일 – 개발자는 시스템 프롬프트를 통해 에이전트의 음성 특성을 제어할 수 있습니다.
  • 강력한 배경 잡음 관리 – 대화 흐름을 방해하지 않으면서도 침묵과 주변 소음을 구분합니다.
  • 장시간 세션의 신뢰성 – 긴 상호작용 동안에도 맥락을 유지하여 대화 품질을 향상시킵니다.
  • 전화 통화 지원 – 예약 및 고객 지원과 같은 전화 기반 사용 사례를 위한 완전 이중 방식 에이전트를 가능하게 합니다.

아키텍처 단순화 및 지연 시간 감소

기존 음성 에이전트는 별도의 음성-to-텍스트, 추론, 텍스트-to-음성 구성 요소를 연결하여 작동합니다. 각 전달 단계마다 지연 시간이 추가되며, 사용자가 중단하거나 정지할 경우 특히 문제점이 발생합니다.

GPT‑Live‑1은 이러한 스택을 단일 모델로 통합하여 다음과 같은 작업을 처리합니다:

  1. ASR 전사 – 사용자의 음성에 대한 실시간 텍스트를 제공합니다.
  2. 턴 감지 – 사용자가 말을 마쳤음을 인식합니다. 비턴 기반 환경에서도 가능합니다.
  3. 응답 생성 – 여전히 중단 여부를 듣고 있는 동안 음성 생성을 수행합니다.
  4. 도구 위임 – 복잡한 쿼리는 백엔드 모델(예: 루나는 고용량 작업용, 아스트라는 세밀한 추론용)로 전달합니다.

배경에서 추론이 진행되는 동안 대화를 유지함으로써 개발자는 더 낮은 엔드투엔드 지연 시간과 더 자연스러운 리듬을 달성할 수 있습니다.


측정된 완전 이중 방식의 장점

OpenAI 내부 평가 결과에 따르면 GPT‑Live‑1은 상당한 성능 향상을 보였습니다:

  • 완전 이중 방식 벤치 성능은 GPT‑Realtime‑2.1 대비 30% 포인트 향상되었으며, 턴 전환 지연 시간이 크게 감소했습니다.
  • GPT‑6 Astra(중간 수준의 추론 노력)와 함께 사용할 경우, GPT‑Live‑1은 Tau3 지표에서 1위를 기록했습니다. 이 지표는 엔드투엔드 작업에서 최전방 음성 에이전트 지능을 측정합니다.
  • 항공, 소매, 통신, 금융 분야의 음성 고객 서비스 벤치마크에서, 작업 성공률, 중단 처리, 도구 사용 정확도 측면에서 더 높은 Pass@1 점수를 기록했습니다.

이러한 결과는 통합된 완전 이중 방식 아키텍처가 기존 최고 수준의 모듈화 파이프라인보다 속도와 작업 성공률 측면에서 뛰어남을 보여줍니다.


새로운 음성 옵션 및 언어 커버리지

GPT‑Live‑1은 이전에 제한된 실시간 음성 목록을 넘어섰습니다. 개발자는 이제 더 넓은 범위의 억양, 방언, 언어 중에서 선택할 수 있으며, 초기에는 호주 영어 영향을 받은 음성부터 시작합니다. OpenAI는 향후 몇 달 동안 음성 및 언어 지원을 지속적으로 추가할 계획입니다.


가격 및 가용성

  • 프론트엔드 음성 레이어: 분당 $0.05
  • 모델은 오늘 API에서 이용 가능하며, 개발자는 비용과 성능 요구 사항에 맞는 어떤 백엔드 모델이나 도구 허브와도 결합할 수 있습니다.
  • 커스텀 음성 접근 및 엔터프라이즈 수준의 배포는 영업 담당자 또는 OpenAI Presence를 통해 가능하며, 이는 엔터프라이즈 환경에서 신뢰할 수 있는 실시간 음성 상호작용을 위해 GPT‑Live‑1을 활용합니다.

개발자가 GPT‑Live‑1을 사용하는 방법

  1. 세션 시작 – API를 호출하고 자연스럽게 말하며, 소음이 많은 환경(예: 카페, 도시 거리)에서 중단 처리를 테스트합니다.
  2. 에이전트 형성 – 시스템 프롬프트를 설정하여 톤, 속도, 대화 스타일을 조정합니다.
  3. 추론 위임 – 복잡한 쿼리나 도구 호출을 위해 백엔드 모델(예: GPT‑6 Astra)을 구성합니다.
  4. 기존 워크플로우 통합 – 제공된 ASR 전사본과 응답 텍스트를 로깅, 분석, 후속 처리에 사용합니다.

고객 피드백 요약

초기 도입자들은 GPT‑Live‑1의 중단 처리 기능이 튜터가 응답하기 전 학습자가 더 많은 생각할 시간을 갖게 해주며, 이전 턴 기반 시스템 대비 중단을 거의 80% 감소시켰다고 보고했습니다.


핵심 메시지

GPT‑Live‑1의 릴리스는 분산된 음성 파이프라인에서 통합된 완전 이중 방식 모델로의 전환을 의미하며, 더 낮은 지연 시간, 더 나은 중단 처리, 더 풍부한 사용자 정의 기능을 제공함으로써 소비자 및 엔터프라이즈 영역에서 자연스러운 음성 중심 애플리케이션의 새로운 가능성을 열어줍니다.

Sources