xAI Grok Speech to Text and Text to Speech APIs
xAI는 두 가지 독립형 오디오 API인 Grok Speech to Text (STT)와 Grok Text to Speech (TTS)를 출시했습니다. 이 엔드포인트를 통해 개발자는 음성 에이전트, 실시간 전사 도구, 접근성 솔루션과 같은 애플리케이션에 고품질 오디오 전사 및 음성 생성을 통합할 수 있습니다.
Grok Speech to Text (STT)
고정밀 전사 및 낮은 지연 시간
Grok STT는 두 가지 주요 인터페이스를 통해 전사 기능을 제공합니다: 대용량 오디오 파일을 밀리초 단위로 처리하는 REST API와 실시간, 저지연 스트리밍 전사를 위한 WebSocket API입니다. 이 시스템은 단어 수준의 타임스탬프, 멀티채널 지원 및 사전 녹음된 오디오와 스트리밍 오디오 모두에서 서로 다른 화자를 식별하는 화자 분리(speaker diarization) 기능을 포함합니다.
역텍스트 정규화 (Inverse Text Normalization)
가공되지 않은 음성 단어를 제공하는 모델과 달리, Grok STT는 역텍스트 정규화(Inverse Text Normalization)를 활용하여 음성 언어를 구조화된 출력으로 변환합니다. 이 프로세스는 숫자, 날짜, 통화 및 기타 엔티티를 지능적으로 형식화하여 출력이 전문적이고 읽기 쉽게 보장합니다.
성능 벤치마크
Grok STT는 기업급 전사를 위해 설계되었으며, 특히 의료, 법률 및 금융 비즈니스 사용 사례에 대한 엔티티 인식에서 탁월한 성능을 보합니다입니다. 다양한 도메인에 걸친 비교 단어 오류율(Word Error Rate, WER) 테스트에서 Grok STT는 다음과 같은 성능을 보여주었습니다:
| Domain (Word Error Rate) | Grok STT | ElevenLabs | Deepgram | AssemblyAI | | :--- | :--- | :--- | :--- | :--- | :--- | | Phone Call Entities | 5.0% | 12.0% | 13.5% | 21.3% | | Video/Podcasts | 2.4% | 2.4% | 3.0% | 3.2% | | Meetings | 10.9% | 12.2% | 16.3% | 15.7% | | Telephone | 9.3% | 9.4% | 11.0% | 11.2% | | Overall | 6.9% | 9.0% | 11.0% | 12.9% |
다국어 지원 및 가격 정책
API는 25개 이상의 언어를 지원하여 원활한 언어 전환이 가능합니다. Grok STT의 가격은 배치 처리를 위해 시간당 $0.10, 스트리밍을 위해 시간당 $0.20로 책정되었습니다.
Grok Text to Speech (TTS)
자연스러운 음성 생성
Grok TTS는 REST API를 사용하여 긴 형식의 텍스트를 음성으로 변환하거나, WebSocket API를 통해 실시간 음성 생성을 가능하게 합니다. 이 모델은 자연스럽고 표현력이 풍부한 전달을 위해 설계되었습니다.
세밀한 운율 제어
개발자는 인라인 및 래핑 음성 태그를 사용하여 생성된 음성의 감정과 운율을 제어할 수 있습니다. 지원되는 태그는 [laugh], [sigh], [whisper], <emphasis>, <slow>, 및 <pause>이며, 복잡한 마크업 없이 생동감 넘치는 오디오를 생성할 수 있습니다.
가격 정책
Text to Speech는 100만 자당 $15.00로 책정되었습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch