xAI Custom Voices 출시

xAI는 사용자가 몇 초간의 오디오를 통해 자신의 목소리를 복제하여 Grok Text to Speech (TTS) 및 Voice Agent API에 즉시 통합할 수 있는 Custom Voices 기능을 출시했습니다. 이를 통해 개발자와 크리에이터는 일반적인 프리셋을 개인화되거나 브랜드 일관성을 유지하거나 정체성을 보존하는 음성 모델로 교체할 수 있습니다.

신속한 음성 복제 및 통합

사용자는 xAI 콘솔 내에서 약 1분 정도의 자연스러운 음성을 녹음함으로써 2분 이내에 제작 준비가 완료된 음성 모델을 생성할 수 있습니다. 생성된 커스텀 보이스는 다음과 같은 기존 Grok 오디오 기능과 완벽하게 호환됩니다:

  • Speech Tags: 전달 방식에 대한 미세한 제어를 지원합니다.
  • Multilingual Output: 여러 언어로 음성을 생성할 수 있는 기능입니다.
  • Streaming: REST 및 WebSocket 스트리밍을 모두 지원합니다.

커스텀 보이스를 구현하려면 개발자는 실시간 대화형 에이전트를 위해 TTS 엔드포인트나 Voice Agent API에 특정 voice_id를 전달하기만 하면 됩니다. xAI는 이러한 API에서 커스텀 보이스를 사용하는 데 추가 비용이 들지 않는다고 밝혔습니다.

주요 사용 사례

Custom Voices는 다양한 산업 분야에에서 광범위한 애플리케이션을 지원하도록 설계되었습니다:

  • Brand Identity: 기업은 브랜드 정체성과 일치하는 일관되고 인식 가능한 목소리를 가진 고객 지원 에이전트를 배포할 수 있습니다.
  • Content Creation: 크리에이터는 반복적인 수동 녹음 없이도 대규모로 비디오, 팟캐스트, 소셜 미디어 게시물을 내레이션할 수 있습니다.
  • Accessibility: 이 기술은 말을 할 수 있는 능력을 상실한 개인의 음성 정체성을 보존하는 데 사용될 수 있습니다.
  • Multilingual Communication: 조직은 영어, 스페인어, 프랑스어, 독일어, 중국어, 일본어를 포함한 여러 주요 언어로 기조 연설이나 메시지를 전달하면서 원본 화자의 목소리를 유지할 수 있습니다.
  • Entertainment: 게임 개발자와 작가는 지속적인 스튜디오 사용 시간 없이도 대화 및 오디오북 내레이션을 위한 독특한 캐릭터 목소리를 생성할 수 있습니다.

음성 안전 및 검증

무단 복제 및 기존 녹음본의 사용을 방지하기 위해 xAI는 2단계 검증 프로세스를 채택합니다:

  1. Passphrase Check: 화자는 특정 검증 문구를 소리 내어 읽어야 합니다. STT (Speech-to-Text) 엔진이 이 문구를 실시간으로 전사하고 일치 여부를 확인하여 사용자의 동의와 존재를 확인합니다.
  2. Speaker Similarity: 시스템은 검증 클립과 전체 녹음본 모두에서 화자 임베딩을 계산하여, 두 오디오 샘플이 동일 인물인지 확인하기 위해 비교합니다.

xAI에 따르면, 이러한 안전 장치는 사용자가 기존 녹음본으로부터 목소리를 복제하거나 타인의 목소리를 복제할 수 없도록 보장합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch