OpenAI 차세대 오디오 모델 API 출시

OpenAI는 API에 새로운 오디오 모델 제품군을 출시하여 보다 지능적이고 맞춤형 음성 에이전트 개발을 가능하게 했습니다. 이 모델들은 최첨단 음성-텍스트 정확도와 최초의 조정 가능한 텍스트-음성 기능을 도입하여, 개발자가 특정 지침에 따라 모델의 발화를 제어할 수 있게 합니다.

향상된 음성-텍스트 기능

OpenAI는 gpt-4o-transcribegpt-4o-mini-transcribe를 도입했으며, 이들은 정확도와 신뢰성 면에서 이전 Whisper 모델을 능가합니다. 이 모델들은 다양한 말하기 속도, 잡음이 많은 배경, 다양한 억양 등 어려운 오디오 환경을 처리하도록 특별히 설계되었습니다.

주요 개선 사항은 다음과 같습니다:

  • Reduced Word Error Rate (WER): 새로운 모델은 100개 이상의 언어를 포함하는 다국어 FLEURS 벤치마크를 비롯한 여러 벤치마크에서 더 낮은 WER을 달성합니다.
  • Benchmark Performance: 이 모델들은 모든 언어 평가에서 Whisper v2와 Whisper v3를 지속적으로 능가합니다.
  • Use Case Optimization: 전사 신뢰성 향상으로 이 모델들은 회의 기록 전사 및 고객 콜센터에 특히 효과적입니다.

조정 가능한 텍스트-음성

새로운 gpt-4o-mini-tts 모델은 조정 가능성을 도입하여 개발자가 말의 전달 방식과 톤을 모델에 지시할 수 있게 합니다. 처음으로 개발자는 "친절한 고객 서비스 담당자처럼 말해 주세요"와 같은 지시를 제공하여 음성의 감정적 울림과 스타일을 맞춤화할 수 있습니다.

이 기능은 스토리텔링을 위한 표현력 있는 내레이션 및 공감적인 고객 서비스 상호작용 등 다양한 맞춤형 애플리케이션을 가능하게 합니다. 현재 이 모델들은 인공적인 사전 설정된 음성에만 제한되어 있어 합성 프리셋과 일치하도록 보장합니다.

기술 혁신

차세대 오디오 모델은 GPT-4o 및 GPT-4o-mini 아키텍처를 기반으로 하며 여러 핵심 기술 발전을 활용합니다:

사전 학습 및 데이터셋

  • Audio-Centric Pretraining: 모델은 성능을 최적화하고 음성 뉘앙스에 대한 깊은 통찰을 제공하기 위해 특화된 오디오 중심 데이터셋을 광범위하게 사전 학습했습니다.

증류 방법론

  • Advanced Distillation: OpenAI는 향상된 증류 기술과 자체 플레이 방법론을 사용하여 대형 오디오 모델의 지식을 더 작고 효율적인 버전으로 전달했습니다. 이를 통해 작은 모델도 현실적인 사용자-보조자 상호작용을 재현함으로써 높은 대화 품질과 반응성을 유지합니다.

강화 학습

  • RL-Heavy Paradigm: 음성-텍스트 모델의 경우, 강화 학습 중심 접근 방식을 통합하여 전사 정확도를 최첨단 수준으로 끌어올렸으며, 특히 환각을 감소시키고 복잡한 인식 상황에서 정밀도를 향상시켰습니다.

API 가용성 및 통합

이 모델들은 음성-텍스트 및 텍스트-음성 API를 통해 모든 개발자에게 제공됩니다. 음성 에이전트 개발을 간소화하기 위해 OpenAI는 Agents SDK와의 통합을 출시했습니다. 낮은 지연 시간의 음성-음성 경험이 필요한 개발자를 위해 OpenAI는 Realtime API에서 제공되는 음성-음성 모델을 권장합니다.

향후 로드맵

OpenAI는 오디오 모델의 지능과 정확성을 지속적으로 향상시킬 계획입니다. 향후 목표에는 개발자가 자체 맞춤형 음성을 도입하면서도 안전 기준을 유지할 수 있는 방안을 모색하는 것이 포함됩니다. 또한 OpenAI는 비디오를 포함한 다른 모달리티에 투자하여 다중 모달 에이전트 경험을 지원하고자 합니다.

Sources