OpenAI gpt-realtime 및 Realtime API 일반 제공
OpenAI는 Realtime API의 일반 제공과 gpt-realtime의 출시를 발표했습니다. gpt-realtime은 프로덕션 수준의 음성 에이전트를 위해 설계된 새로운 음성-음성 모델입니다. 이번 업데이트는 이미지 입력에 대한 네이티브 지원, 원격 Model Context Protocol (MCP) 서버, 그리고 전화 네트워크 통합을 위한 Session Initiation Protocol (SIP)을 도입하여 음성 기반 AI 에이전트의 활용도를 크게 확대합니다.
gpt-realtime 모델
gpt-realtime은 오디오를 직접 처리하고 생성하는 네이티브 음성-음성 모델로, 별도의 음성-텍스트 및 텍스트-음성 파이프라인이 필요하지 않습니다. 이 아키텍처는 지연 시간을 줄이고 인간 음성의 뉘앙스를 보존합니다.
오디오 품질 및 표현력
이 모델은 보다 자연스러운 억양, 감정, 그리고 속도를 생성하도록 학습되었습니다. 스타일에 대한 세밀한 지시를 따를 수 있는데, 예를 들어 "프랑스 억양으로 공감하며 말하기" 혹은 "빠르고 전문적으로 말하기"와 같습니다. OpenAI는 새로운 독점 음성 두 개인 Cedar와 Marin을 도입했으며, 기존의 여덟 개 음성을 업데이트하여 이러한 품질 향상을 활용하도록 했습니다.
지능 및 추론
gpt-realtime은 웃음과 같은 비언어적 신호와 원시 오디오에 대한 이해도가 향상되었습니다. 문장 중간에 언어를 전환할 수 있으며, 스페인어, 중국어, 일본어, 프랑스어에서 알파벳-숫자 시퀀스(예: 전화번호 또는 VIN)를 보다 정확하게 감지합니다.
추론 측면에서, 이 모델은 Big Bench Audio 벤치마크에서 82.8% 정확도를 달성했으며, 이는 2024년 12월 모델의 65.6%와 비교됩니다.
명령 따르기 및 함수 호출
명령 따르기 개선으로 모델은 개발자 프롬프트를 보다 엄격히 따를 수 있게 되었으며, 예를 들어 면책 조항 스크립트를 한 단어씩 정확히 읽는 것이 가능합니다. MultiChallenge 오디오 벤치마크에서 gpt-realtime은 30.5% 점수를 기록했으며, 이전 모델의 20.6%보다 상승했습니다.
함수 호출 기능이 세 가지 측면에서 강화되었습니다: 호출된 함수의 관련성, 호출 시점, 그리고 인수의 정확성. ComplexFuncBench 오디오 평가에서 gpt-realtime은 66.5% 점수를 기록했으며, 이전 모델의 49.7%와 비교됩니다. 또한, 모델은 이제 비동기 함수 호출을 네이티브하게 지원하여, 장기 실행 도구 결과를 기다리는 동안에도 대화가 원활하게 유지됩니다.
Realtime API 기능 업데이트
모델 업데이트 외에도, Realtime API는 여러 프로덕션 지향 기능을 도입합니다:
- 원격 MCP 서버 지원: 개발자는 세션 구성에 원격 MCP 서버 URL을 제공하여 Model Context Protocol (MCP) 지원을 활성화할 수 있으며, 이를 통해 API가 수동 통합 없이 도구 호출을 자동으로 처리합니다.
- 이미지 입력: 모델은 이제 오디오 또는 텍스트와 함께 이미지, 사진, 스크린샷을 처리할 수 있습니다. 이를 통해 에이전트는 시각적 컨텍스트에 기반해 대화를 진행할 수 있어, 사용자는 공유된 이미지에서 모델이 "보는" 내용에 대해 질문할 수 있습니다.
- SIP 지원: Session Initiation Protocol (SIP)에 대한 직접 지원을 통해 개발자는 음성 에이전트를 공중 전화망, PBX 시스템, 데스크폰에 연결할 수 있습니다.
- 재사용 가능한 프롬프트: 개발자는 이제 도구, 변수, 예시 메시지를 포함한 프롬프트를 다양한 Realtime API 세션 간에 저장하고 재사용할 수 있습니다.
안전, 프라이버시 및 가격
오용을 방지하기 위해 OpenAI는 세션을 모니터링하는 활성 분류기를 사용하며, 유해 콘텐츠 가이드라인을 위반하는 대화를 중단할 수 있습니다. 개발자는 추가적인 안전 장치를 위해 Agents SDK 사용을 권장받습니다. 사용 정책은 개발자가 사용자에게 AI와 상호작용하고 있음을 고지하도록 요구하며, 스팸이나 사기에 서비스를 사용하는 것을 금지합니다.
가격 및 제공 여부
gpt-realtime은 모든 개발자에게 즉시 제공됩니다. 가격은 gpt-4o-realtime-preview에 비해 20% 인하되었습니다:
- 오디오 입력: 1백만 토큰당 $32 (캐시된 입력 토큰은 $0.40).
- 오디오 출력: 1백만 토큰당 $64.
개발자는 이제 대화 컨텍스트에 대해 세밀한 제어가 가능해져, 토큰 제한을 설정하고 회차를 잘라내어 장기 세션에서 비용을 관리할 수 있습니다.