kyutai-labs/unmute

Make text LLMs listen and speak

解決的問題

Unmute 讓標準的文本型大型語言模型(LLM)能夠參與即時語音對話。透過整合高效率的語音轉文字(STT)與文字轉語音(TTS)模型,降低語音介面通常伴隨的延遲,彌補文本 LLM 與語音互動之間的差距。

工作原理

Unmute 作為一個編排層,將專用音訊模型包裝在文本 LLM 外層:

  1. 語音轉文字(STT):透過 WebSocket 連接即時轉錄使用者的音訊輸入。
  2. LLM 處理:當 STT 檢測到使用者說話結束時,將轉錄的文字傳送給 LLM(如 Gemma 3 或透過 OpenRouter/vLLM 的模型)以產生文字回應。
  3. 文字轉語音(TTS):將 LLM 的文字輸出串流至 TTS 引擎,轉換回音訊並傳給使用者。

適用對象

  • 希望為既有文本 LLM 加入低延遲語音功能的 開發者
  • 正在實驗即時音訊-文字-音訊流程的 研究人員
  • 希望使用開源模型建置私有語音 AI 助手的 自架設使用者

主要特色

  • 低延遲:優化 STT 與 TTS 元件,確保對話流暢。
  • LLM 無關:相容任何 OpenAI 兼容的 LLM 伺服器(vLLM、Ollama、OpenRouter)。
  • 彈性部署:支援 Docker Compose 快速設定、無 Docker 手動控制,以及 Docker Swarm 擴展。
  • 可自訂語音:透過設定檔可變更角色與語音。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案