xAI Grok Speech to Text and Text to Speech APIs

xAI 已推出兩款獨立的音訊 API:Grok Speech to Text (STT) 與 Grok Text to Speech (TTS)。這些端點允許開發者將高品質的音訊轉錄與語音生成整合至語音代理、即時轉錄工具及無障礙解決方案等應用程式中。

Grok Speech to Text (STT)

高準確度轉錄與低延遲

Grok STT 透過兩個主要介面提供轉錄功能:用於在毫秒內處理大型音訊檔案的 REST API,以及用於即時、低延遲串流轉錄的 WebSocket API。該系統包含字級時間戳記、多聲道支援,以及用於識別預錄與串流音訊中不同說話者的說話者分段 (speaker diarization)。

反向文本正規化 (Inverse Text Normalization)

與僅提供原始口語文字的模型不同,Grok STT 利用反向文本正規化將口語語言轉換為結構化輸出。此過程會智慧地格式化數字、日期、貨幣及其他實體,以確保輸出內容專業且具可讀性。

效能基準測試

Grok STT 專為企業級轉錄而設計,特別在醫療、法律及金融業務情境下的實體識別方面表現卓越。在跨不同領域的字錯誤率 (Word Error Rate, WER) 比較測試中,Grok STT 展示了以下效能:

| Domain (Word Error Rate) | Grok STT | ElevenLabs | Deepgram | AssemblyAI | | :--- | :--- | :--- | :--- | :--- | :--- | | Phone Call Entities | 5.0% | 12.0% | 13.5% | 21.3% | | Video/Podcasts | 2.4% | 2.4% | 3.0% | 3.2% | | Meetings | 10.9% | 12.2% | 16.3% | 15.7% | | Telephone | 9.3% | 9.4% | 11.0% | 11.2% | | Overall | 6.9% | 9.0% | 11.0% | 12.9% |

多語言支援與定價

API 支援超過 25 種語言,可實現無縫語言切換。Grok STT 的定價設定為批次處理每小時 $0.10,串流處理每小時 $0.20。

Grok Text to Speech (TTS)

自然語音生成

Grok TTS 可透過 REST API 將長篇文本轉換為語音,或透過 WebSocket API 進行即時語音生成。該模型旨在提供自然且具表現力的語音傳遞。

細粒度韻律控制

開發者可以使用內嵌式與包圍式語音標籤來控制生成語音的情緒與韻律。支援的標籤包括 [laugh], [sigh], [whisper], <emphasis>, <slow>, 與 <pause>,讓開發者無需複雜的標記語言即可創造出栩栩如生的音訊。

定價

Text to Speech 的定價為每 100 萬個字元 $15.00。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch