xAI Grok Speech to Text and Text to Speech APIs

xAI 推出了两个独立的音频 API:Grok Speech to Text (STT) 和 Grok Text to Speech (TTS)。这些端点允许开发者将高质量的音频转录和语音生成集成到语音代理、实时转录工具和无障碍解决方案等应用程序中。

Grok Speech to Text (STT)

高精度转录和低延迟

Grok STT 通过两个主要接口提供转录功能:用于在毫秒级处理大型音频文件的 REST API,以及用于实时、低延迟流式转录的 WebSocket API。该系统包括词级时间戳、多通道支持以及说话人日志(speaker diarization),用于识别预录音频和流式音频中的不同说话人。

逆文本规范化 (Inverse Text Normalization)

与仅提供原始口语词汇的模型不同,Grok STT 利用逆文本规范化将口语转换为结构化输出。此过程会智能地格式化数字、日期、货币和其他实体,以确保输出结果专业且具可读性。

性能基准测试

Grok STT 专为企业级转录而设计,特别是在医疗、法律和金融业务场景下的实体识别方面表现出色。在跨多个领域的词错误率 (WER) 对比测试中,Grok STT 展示了以下性能:

| Domain (Word Error Rate) | Grok STT | ElevenLabs | Deepgram | AssemblyAI | | :--- | :--- | :--- | :--- | :--- | :--- | | Phone Call Entities | 5.0% | 12.0% | 13.5% | 21.3% | | Video/Podcasts | 2.4% | 2.4% | 3.0% | 3.2% | | Meetings | 10.9% | 12.2% | 16.3% | 15.7% | | Telephone | 9.3% | 9.4% | 11.0% | 11.2% | | Overall | 6.9% | 9.0% | 11.0% | 12.9% |

多语言支持和定价

该 API 支持超过 25 种语言,允许无缝切换语言。Grok STT 的定价为:批量处理每小时 $0.10,流式传输每小时 $0.20。

Grok Text to Speech (TTS)

自然语音生成

Grok TTS 可以通过 REST API 将长文本转换为语音,或者通过 WebSocket API 进行实时语音生成。该模型旨在实现自然且富有表现力的表达。

细粒度韵律控制

开发者可以使用行内和包装语音标签来控制生成语音的情感和韵律。支持的标签包括 [laugh], [sigh], [whisper], <emphasis>, <slow>, 和 <pause>,从而无需复杂的标记即可创建栩栩如生的音频。

定价

文本转语音的定价为每 100 万个字符 $15.00。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch