kyutai-labs/unmute
Make text LLMs listen and speak
何を解決するか
Unmuteは、標準的なテキストベースの大規模言語モデル(LLM)がリアルタイムの音声会話に参加できるようにします。高パフォーマンスな音声認識(STT)および音声合成(TTS)モデルを統合することで、音声インターフェースに通常伴う遅延を低減し、テキストLLMと音声インタラクションのギャップを埋めます。
動作方法
Unmuteは、専用の音声モデルでテキストLLMをラップするオーケストレーション層として機能します:
- 音声認識(STT):WebSocket接続を介してユーザーの音声入力をリアルタイムで文字起こしします。
- LLM処理:STTがユーザーの発話終了を検出すると、文字起こしされたテキストがLLM(Gemma 3やOpenRouter/vLLM経由のモデルなど)に送られ、テキスト応答が生成されます。
- 音声合成(TTS):LLMのテキスト出力をTTSエンジンにストリーミングし、音声に変換してユーザーに送信します。
対象ユーザー
- 既存のテキストLLMに低遅延音声機能を追加したい開発者。
- リアルタイム音声-テキスト-音声パイプラインを実験したい研究者。
- オープンソースモデルを使用してプライベートな音声対応AIアシスタントを自前ホスティングしたい自己ホスティングユーザー。
特徴
- 低遅延:スムーズな会話を実現する最適化されたSTTおよびTTSコンポーネント。
- LLM非依存:OpenAI互換LLMサーバー(vLLM、Ollama、OpenRouter)と互換性あり。
- 柔軟なデプロイ:Docker Composeによる簡単セットアップ、Dockerレスによる手動制御、Docker Swarmによるスケーリングをサポート。
- カスタマイズ可能な声:設定ファイルでキャラクターや声を変更可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト