xAI Grok Voice Agent APIリリース

xAIは、リアルタイムのデータ検索、ツール呼び出し、多言語コミュニケーションが可能な音声エージェントの構築を可能にするGrok Voice Agent APIをリリースしました。このAPIは、テスラ車両およびxAIモバイルアプリケーションで使用されている同じテクノロジースタックに基づいています。

高性能な音声推論と低遅延

Grok Voice Agent APIは、速度と知能を重視して設計されており、Big Bench Audioの音声推論ベンチマークで1位を獲得しています。平均的な最初の音声までの時間は1秒未満であり、xAIによると、これにより最も近い競合製品と比べてほぼ5倍の高速性を実現しています。

この性能は、xAIが自社開発した完全な音声スタックによって達成されています。音声活動検出(VAD)、トークナイザー、音声モデルをすべて自前で訓練することで、システムの知能と速度に対する細かい制御を維持しています。

コスト効率性と課金モデル

Grok Voice Agent APIは、音声の長さに応じて1分あたり$0.05のフラットレート課金モデルを採用しています。xAIは、このモデルをOpenAI Realtime APIのようなトークンベースの課金モデルと比較し、実際の運用では通常1分あたり$0.10を超えると推定しています。

多言語対応と人間評価

Grok Voiceエージェントは、数十の言語でネイティブレベルの習得度を持ち、ユーザーの言語を自動検出したり、会話中に言語を切り替えることができます。開発者はシステムプロンプトを使って特定の応答言語を強制することも可能です。

OpenAI Realtime APIとの盲検比較人間評価において、Grokは発音、アクセント、リズムの点で一貫して好まれるモデルとして評価されました。

テスラとの統合とリアルタイムツール利用

テスラはAPIの重要な設計パートナーでした。テスラ車両では、Grokは専用ツールと統合され、車両の状態の取得、ナビゲーションの制御、ルート計画が、Xの検索データとルート計算を組み合わせることで実現されています。

APIを使用する開発者は、独自のカスタムツールを統合するか、xAIのリアルタイム検索機能(ウェブおよびXを対象)を活用して、エージェントがタスクを実行し、最新情報を取得できるようにできます。

表現力豊かな音声オプションと聴覚的サイン

APIはAra、Eve、Leoなど、表現力豊かな複数の音声を提供しています。これらの音声は、法務、金融、医療分野における専門用語の正確な発音を可能にする自然な会話に最適化されています。

リアリズムを高めるために、モデルは開発者がプロンプトできる聴覚的サイン([whisper]、[sigh]、[laugh]など)をサポートしています。

開発者向け実装とロードマップ

Grok Voice Agent APIはOpenAI Realtime API仕様と互換性があり、公式のxAI LiveKitプラグイン経由で利用可能です。ブラウザベースでのテスト用に、xAI Cloudコンソールに音声プレイグラウンドが用意されています。

今後数週間でリリース予定のアップデートには以下のものがあります:

  • オンライン独立型のテキスト読み上げ(TTS)および音声認識(STT)エンドポイント。
  • 発音と遅延のさらなる改善が施された音声モデル。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch