OpenAI, API에서 GPT-Realtime-2, GPT-Realtime-Translate, GPT-Realtime-Whisper를 소개합니다
개요
OpenAI는 Realtime API를 위해 세 가지 오디오 모델인 GPT‑Realtime‑2, GPT‑Realtime‑Translate, GPT‑Realtime‑Whisper를 발표했습니다. 이 모델들은 개발자들이 보다 자연스럽고, 더 지능적으로 응답하며, 실시간으로 행동을 취하는 음성 경험을 만들 수 있도록 목표합니다.
GPT‑Realtime‑2 기능
GPT‑Realtime‑2는 실시간 음성 상호작용에 GPT‑5 수준의 추론을 추가합니다. 개발자는 최소, 낮음, 중간, 높음, 초고(xhigh) 중에서 추론 강도를 선택할 수 있으며, 기본값은 낮음입니다. 모델은 작업을 알리는 “let me check that”와 같은 서두, 청각 피드백이 있는 병렬 도구 호출, 강화된 복구 동작, 32K에서 128K로 확장된 컨텍스트 윈도우, 도메인 특화 용어의 더 나은 유지, 그리고 톤과 전달을 제어할 수 있는 기능을 지원합니다.
오디오 평가에서 GPT‑Realtime‑2 (high)는 Big Bench Audio에서 오디오 인텔리전스 점수가 GPT‑Realtime‑1.5보다 15.2% 높게 나타났으며, GPT‑Realtime‑2 (xhigh)는 Audio MultiChallenge에서 지시 수행 점수가 13.8% 높았습니다. Zillow 벤치마크에서는 프롬프트 최적화를 통해 통화 성공률이 26포인트 상승했습니다 (95% 대 69%).
“GPT‑Realtime‑2에서 눈에 띈 점은 복잡한 음성 상호작용에 제공되는 지능과 도구 호출 신뢰성입니다. 가장 어려운 적대적 벤치마크에서 프롬프트 최적화 후 통화 성공률이 26포인트 상승했습니다 (95% 대 69%). GPT‑Realtime‑2는 또한 우리 비즈니스에 중요한 공정 주택(Fair Housing) 준수 측면에서 실질적으로 더 견고합니다. 에이전트 역량과 가드레일 강도의 조합이 Zillow에서 프로덕션 음성에 적합하게 만드는 요인입니다. — Josh Weisberg, SVP 및 Zillow AI 책임자
GPT‑Realtime‑Translate 기능
GPT‑Realtime‑Translate는 70개 이상의 입력 언어를 13개 출력 언어로 실시간 음성 번역을 제공하며 화자와 동기화됩니다. 이는 고객 지원, 국경 간 판매, 교육, 이벤트, 미디어 및 전 세계 청중을 대상으로 하는 크리에이터 플랫폼을 위해 설계되었습니다.
힌디어, 타밀어, 텔루구어에 대한 평가에서, 이 모델은 테스트된 다른 모든 모델보다 12.5% 낮은 단어 오류율을 보였으며, 폴백 비율이 낮고 작업 완료율이 높으며 자연스러운 대화를 유지하는 지연 시간을 제공했습니다.
“인도를 위한 음성 AI 구축은 다양한 지역 발음을 다루는 것을 의미합니다. 힌디어, 타밀어, 텔루구어에 대한 평가에서 GPT‑Realtime‑Translate는 테스트한 다른 모든 모델보다 12.5% 낮은 단어 오류율을 보였으며, 폴백 비율이 낮고 작업 완료율이 높으며 자연스러운 대화를 유지하는 지연 시간을 제공했습니다. 이는 다국어 음성 AI의 새로운 기준을 제시합니다. — Prateek Sachan, BolnaAI 공동 설립자 겸 CTO
GPT‑Realtime‑Whisper 기능
GPT‑Realtime‑Whisper는 사람들이 말하는 동안 오디오를 실시간으로 전사하는 스트리밍 음성‑텍스트 모델로, 저지연 자막, 실시간 회의 노트, 음성 에이전트를 위한 지속적인 이해를 가능하게 합니다. 회의 자막, 교실 전사, 방송 자막, 고객 지원, 의료, 영업, 채용 및 기타 대량 음성 상호작용에서 빠른 후속 작업 흐름과 같은 사용 사례를 지원합니다.
음성 상호작용 패턴
개발자는 이러한 모델을 세 가지 새로운 음성 AI 패턴에 적용할 수 있습니다:
- Voice‑to‑action: 사용자가 필요를 설명하면 시스템이 추론하고, 도구를 사용하며, 작업을 완료합니다 (예: Zillow의 주택 검색 어시스턴트).
- Systems‑to‑voice: 소프트웨어가 컨텍스트를 실시간 음성 안내로 변환합니다 (예: 게이트 변경 및 경로를 알리는 여행 앱).
- Voice‑to‑voice: AI가 언어, 작업 또는 변하는 컨텍스트를 넘어 실시간 대화를 지속하도록 돕습니다 (예: Deutsche Telekom의 다국어 지원).
이러한 패턴은 결합될 수 있습니다; Priceline은 검색, 변경 처리, 실시간 업데이트 제공 및 현장에서 대화 번역을 수행하는 음성 기반 여행 관리자를 개발 중입니다.
안전 및 사용
Realtime API는 유해 콘텐츠 가이드라인을 위반하는 세션을 중단할 수 있는 활성 분류기를 포함합니다. 개발자는 Agents SDK를 통해 추가 가드레일을 추가할 수 있습니다. 사용 정책은 출력물을 스팸, 사기 또는 기타 유해한 목적으로 재사용하는 것을 금지하며, 컨텍스트상 명확하지 않은 경우 AI 상호작용을 공개해야 합니다.
가격 및 가용성
GPT‑Realtime‑2는 100만 오디오 입력 토큰당 $32(캐시된 입력 토큰은 $0.40)이며, 100만 오디오 출력 토큰당 $64입니다. GPT‑Realtime‑Translate는 분당 $0.034, GPT‑Realtime‑Whisper는 분당 $0.017에 가격이 책정됩니다. 세 모델 모두 현재 Realtime API에서 이용 가능합니다.
시작하기
시작하려면 제공된 Codex 프롬프트를 열어 최소 Realtime‑2 WebRTC 음성 에이전트를 추가하거나 확장하거나, 아직 설치되지 않은 경우 Codex 앱을 다운로드하십시오. 프롬프트에는 서버 측 세션 엔드포인트 설정, RTCPeerConnection을 통한 마이크와 오디오 출력 연결, 그리고 check_calendar와 같은 샘플 도구 등록 방법이 포함되어 있습니다.