xAI Grok Speech to Text and Text to Speech APIs

xAIは、2つの独立したオーディオAPI、Grok Speech to Text (STT) と Grok Text to Speech (TTS) をリリースしました。これらのエンドポイントにより、開発者は音声エージェント、リアルタイム文字起こしツール、アクセシビリティ・ソリューションなどのアプリケーションに、高品質な音声文字起こしと音声生成を統合できます。

Grok Speech to Text (STT)

高精度な文字起こしと低レイテンシ

Grok STTは、主に2つのインターフェースを通じて文字起こし機能を提供します。ミリ秒単位で大規模なオーディオファイルを処理するREST APIと、リアルタイムで低レイテンシなストリーミング文字起こしを行うWebSocket APIです。このシステムには、単語レベルのタイムスタンプ、マルチチャネル対応、および録音済みまたはストリーミング音声の両方で異なる話者を識別する話者ダイアリゼーションが含まれています。

逆テキスト正規化 (Inverse Text Normalization)

Grok STTは、生の話し言葉を提供するモデルとは異なり、Inverse Text Normalizationを利用して話し言葉を構造化された出力に変換します。このプロセスにより、数字、日付、通貨、その他のエンティティがインテリジェントにフォーマットされ、出力がプロフェッショナルで読みやすいものになります。

パフォーマンス・ベンチマーク

Grok STTは、エンタープライズグレードの文字起こし向けに設計されており、特に医療、法律、金融のビジネスユースケースにおけるエンティティ認識に優れています。さまざまなドメインにおける比較Word Error Rate (WER) テストにおいて、Grok STTは以下のパフォーマンスを示しました:

| Domain (Word Error Rate) | Grok STT | ElevenLabs | Deepgram | AssemblyAI | | :--- | :--- | :--- | :--- | :--- | :--- | | Phone Call Entities | 5.0% | 12.0% | 13.5% | 21.3% | | Video/Podcasts | 2.4% | 2.4% | 3.0% | 3.2% | | Meetings | 10.9% | 12.2% | 16.3% | 15.7% | | Telephone | 9.3% | 9.4% | 11.0% | 11.2% | | Overall | 6.9% | 9.0% | 11.0% | 12.9% |

多言語対応と価格設定

APIは25以上の言語をサポートしており、シームレスな言語切り替えが可能です。Grok STTの価格は、バッチ処理で1時間あたり$0.10、ストリーミングで1時間あたり$0.20に設定されています。

Grok Text to Speech (TTS)

自然な音声生成

Grok TTSは、REST APIを使用して長文テキストを音声に変換するか、WebSocket APIを介してリアルタイムの音声生成を行います。このモデルは、自然で表現力豊かなデリバリーのために設計されています。

きめ細かな韻律(Prosody)制御

開発者は、インラインおよびラップ型の音声タグを使用して、生成された音声の感情や韻律を制御できます。サポートされているタグには [laugh], [sigh], [whisper], <emphasis>, <slow>, and <pause> が含まれ、複雑なマークアップなしで、生き生きとしたオーディオを作成できます。

価格設定

Text to Speechは、100万文字あたり$15.00です。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch