kyutai-labs/unmute
Make text LLMs listen and speak
解決的問題
Unmute 讓標準的文本型大型語言模型(LLM)能夠參與即時語音對話。透過整合高效率的語音轉文字(STT)與文字轉語音(TTS)模型,降低語音介面通常伴隨的延遲,彌補文本 LLM 與語音互動之間的差距。
工作原理
Unmute 作為一個編排層,將專用音訊模型包裝在文本 LLM 外層:
- 語音轉文字(STT):透過 WebSocket 連接即時轉錄使用者的音訊輸入。
- LLM 處理:當 STT 檢測到使用者說話結束時,將轉錄的文字傳送給 LLM(如 Gemma 3 或透過 OpenRouter/vLLM 的模型)以產生文字回應。
- 文字轉語音(TTS):將 LLM 的文字輸出串流至 TTS 引擎,轉換回音訊並傳給使用者。
適用對象
- 希望為既有文本 LLM 加入低延遲語音功能的 開發者。
- 正在實驗即時音訊-文字-音訊流程的 研究人員。
- 希望使用開源模型建置私有語音 AI 助手的 自架設使用者。
主要特色
- 低延遲:優化 STT 與 TTS 元件,確保對話流暢。
- LLM 無關:相容任何 OpenAI 兼容的 LLM 伺服器(vLLM、Ollama、OpenRouter)。
- 彈性部署:支援 Docker Compose 快速設定、無 Docker 手動控制,以及 Docker Swarm 擴展。
- 可自訂語音:透過設定檔可變更角色與語音。
相關
- 專案
- 專案
- 專案
- 專案
- 專案