jamiepine/voicebox

The open-source AI voice studio. Clone, dictate, create.

解決的問題

Voicebox 是一個以本地為先的 AI 語音工作室,提供語音克隆、語音生成與系統級語音輸入的統一介面。它消除了對獨立雲端服務(如 ElevenLabs 的語音輸出或 WisprFlow 的語音輸入)的需求,讓使用者能完全在本地執行整個語音 I/O 循環,實現完全隱私保護且無需訂閱費用。

工作原理

此應用程式整合了多個專用 AI 模型,用於不同任務:

  • 文字轉語音(TTS): 整合七種不同的 TTS 引擎(包括 Qwen3-TTS、Kokoro 和 LuxTTS),支援多語言克隆與富有表現力的語音。
  • 語音轉文字(STT): 使用 OpenAI Whisper 提供高品質轉錄,適用於語音輸入與音訊擷取。
  • 本地 LLM: 內建的 Qwen3 LLM 負責文字優化(清理語音輸入中的卡頓)與「語音個性」功能,可在語音輸出前將文字重寫為特定角色的風格。
  • 整合: 基於 Tauri(Rust)與 FastAPI(Python)建構,提供 REST API 與 MCP(模型上下文協定)伺服器,使 Claude Code 或 Cursor 等 AI 代理能使用克隆語音發聲。

適用對象

  • 內容創作者: 使用多語音時間軸編輯器製作播客、敘事或遊戲對話的人。
  • 開發者: 需要本地、私有語音介面建構 AI 代理的人。
  • 無障礙使用者: 需要本地運行語音輔助工具的人。
  • 代理型 AI 使用者: 使用支援 MCP 的代理,希望其 AI 助手擁有獨特克隆語音的使用者。

主要亮點

  • 本地為先的隱私: 所有模型與語音資料均保留在使用者裝置上。
  • uma 7 TTS 引擎: 支援 23 種語言,可從短音訊樣本實現零樣本語音克隆。
  • 系統級語音輸入: macOS 上的全域快捷鍵支援推鍵語音輸入,可直接將文字貼到任何焦點應用程式中。
  • MCP 伺服器: 內建支援模型上下文協定(MCP),使 AI 代理能觸發語音輸出。
  • 故事編輯器: 多軌時間軸,用於編排複雜對話與播客。
  • 音訊效果: 集成後處理效果,如音高變換、混響與壓縮,由 Spotify 的 pedalboard 提供支援。
  • 廣泛硬體支援: 適用於 Apple Silicon(MLX)、NVIDIA(CUDA)、AMD(ROCm)與 Intel Arc GPU 進行最佳化。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案