xAI Custom Voices リリース

xAIは、数秒間の音声からユーザー自身の声をクローンし、Grok Text to Speech (TTS) および Voice Agent APIに即座に統合できる機能「Custom Voices」をリリースしました。これにより、開発者やクリエイターは、汎用的なプリセットを、パーソナライズされた、ブランドに一貫性のある、あるいはアイデンティティを維持した音声モデルに置き換えることが可能になります。

Rapid Voice Cloning and Integration

ユーザーは、xAIコンソール内で約1分間の自然な発話音声を録音することで、2分足らずで実用的な音声モデルを作成できます。作成されたカスタムボイスは、以下のものを含む既存のGrokオーディオ機能と完全に互換性があります:

  • Speech Tags: 表現のニュアンスを制御するためのサポート。
  • Multilingual Output: 多言語での音声生成能力。
  • Streaming: RESTおよびWebSocketストリーミングの両方のサポート。

カスタムボイスを実装するには、開発者はTTSエンドポイントまたはリアルタイム対話型エージェント用のVoice Agent APIに対して、特定の voice_id を渡すだけです。xAIは、これらのAPIでカスタムボイスを使用することによる追加料金は発生しないと述べています。

Key Use Cases

Custom Voicesは、さまざまな業界にわたる幅広いアプリケーションをサポートするように設計されています:

  • Brand Identity: 企業は、ブランドアイデンティティに沿った、一貫性があり認識しやすい声を持つカスタマーサポートエージェントを導入できます。
  • Content Creation: クリエイターは、繰り返しの手動録音を必要とせずに、ビデオ、ポッドキャスト、ソーシャルメディアの投稿を大規模にナレーションさせることができます。
  • Accessibility: この技術は、話す能力を失った個人の音声アイデンティティを維持するために使用できます。
  • Multilingual Communication: 組織は、英語、スペイン語、フランス語、ドイツ語、中国語、日本語を含む主要な多言語で、元の話者の声を維持しながら基調講演やメッセージを配信できます。
  • Entertainment: ゲーム開発者や著者は、スタジオでの継続的な時間を必要とせずに、対話やオーディオブックのナレーションのためのユニークなキャラクターボイスを作成できます。

Voice Safety and Verification

不正なクローニングや既存の録音の使用を防ぐため、xAIは2段階の検証プロセスを採用しています:

  1. Passphrase Check: 話者は特定の検証用フレーズを声に出して読む必要があります。STT (Speech-to-Text) エンジンがこのフレーズをリアルタイムで文字起こしし、一致を確認することで、ユーザーの同意と存在を確認します。
  2. Speaker Similarity: システムは、検証用クリップとフル録音の両方から話者埋め込み(speaker embeddings)を計算し、それらを比較して、両方のオーディオサンプルが同一人物のものであることを確認します。

xAIによれば、これらの保護策により、ユーザーが既存の録音から声をクローンしたり、他人の声をクローンしたりすることができないようになっています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch