kyutai-labs/unmute

Make text LLMs listen and speak

何を解決するか

Unmuteは、標準的なテキストベースの大規模言語モデル(LLM)がリアルタイムの音声会話に参加できるようにします。高パフォーマンスな音声認識(STT)および音声合成(TTS)モデルを統合することで、音声インターフェースに通常伴う遅延を低減し、テキストLLMと音声インタラクションのギャップを埋めます。

動作方法

Unmuteは、専用の音声モデルでテキストLLMをラップするオーケストレーション層として機能します:

  1. 音声認識(STT):WebSocket接続を介してユーザーの音声入力をリアルタイムで文字起こしします。
  2. LLM処理:STTがユーザーの発話終了を検出すると、文字起こしされたテキストがLLM(Gemma 3やOpenRouter/vLLM経由のモデルなど)に送られ、テキスト応答が生成されます。
  3. 音声合成(TTS):LLMのテキスト出力をTTSエンジンにストリーミングし、音声に変換してユーザーに送信します。

対象ユーザー

  • 既存のテキストLLMに低遅延音声機能を追加したい開発者
  • リアルタイム音声-テキスト-音声パイプラインを実験したい研究者
  • オープンソースモデルを使用してプライベートな音声対応AIアシスタントを自前ホスティングしたい自己ホスティングユーザー

特徴

  • 低遅延:スムーズな会話を実現する最適化されたSTTおよびTTSコンポーネント。
  • LLM非依存:OpenAI互換LLMサーバー(vLLM、Ollama、OpenRouter)と互換性あり。
  • 柔軟なデプロイ:Docker Composeによる簡単セットアップ、Dockerレスによる手動制御、Docker Swarmによるスケーリングをサポート。
  • カスタマイズ可能な声:設定ファイルでキャラクターや声を変更可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト