Hugging Face と Cerebras の Gemma 4 を使ったリアルタイム音声 AI
Hugging Face と Cerebras の Gemma 4 を使ったリアルタイム音声 AI
Hugging Face と Cerebras は、オープンソースモデルと高速推論を組み合わせたリアルタイム音声間音声パイプラインを導入し、音声 AI に典型的に関連する遅延ボトルネックを解消しました。Google DeepMind の Gemma 4 31B と Cerebras 推論を組み合わせることで、自然な人間ような会話に必要な応答性を達成します。
オープンなカスケード型音声間音声アーキテクチャ
このシステムは、各コンポーネントが置換可能なモジュラーなオープンソーススタックを利用しており、開発者はロボット、アシスタント、または研究向けにパイプラインを適応させることができます。完全な音声間音声ループは、以下のステージで構成されます:
- 音声入力: 初期のオーディオキャプチャ。
- 音声認識: Nvidia's Parakeet によって駆動されます。
- 言語モデル推論: Cerebras ハードウェア上で動作する Gemma 4 31B。
- テキストから音声への変換 (TTS): Alibaba's Qwen3TTS によって駆動されます。
- 音声応答: 最終的なオーディオ出力。
このモジュラーアプローチにより、パイプラインの各層を検査、変更、拡張することが開発者によって可能になります。
レイテンシと P95 安定性の解決
Cerebras は、音声 AI の主要なボトルネックである言語モデル応答時間に対処するために使用されます。多くの本番システムでは中央値の遅延は許容範囲内ですが、応答時間の 95 パーセンタイル (P95) においてマルチ秒の遅延が発生しやすく、これがインタラクションを信頼できないものに感じさせます。
Cerebras はより高速かつ安定した推論を提供し、これらの長尾遅延を削減します。この安定性は、ツール呼び出しやマルチモーダルステップを含む複雑なインタラクションにおいて重要で、複数の会話ターンが必要となります。
エンボディド AI とロボティクスへの応用
このパイプラインによって提供される応答性は、エンボディド AI において不可欠です。ここではレイテンシは美容上の要件ではなく機能的要件です。この特定の音声間音声パイプラインは現在、Reachy Mini ロボットを駆動しており、9,000 台以上が導入されています。
発表によると、Cerebras の統合は、ロボットおよび音声アシスタントとのインタラクションをスケールで自然に感じさせるために、低遅延と予測可能なパフォーマンスの必要性によって推進されています。
開発者向けリソース
開発者は以下のリソースを通じて実装にアクセスできます:
- デモ: Hugging Face スペース
- リポジトリ: huggingface/speech-to-speech