jamiepine/voicebox

The open-source AI voice studio. Clone, dictate, create.

解决的问题

Voicebox 是一个以本地优先的 AI 语音工作室,提供语音克隆、语音生成和系统级语音输入的统一界面。它消除了对独立云服务(如 ElevenLabs 的语音输出或 WisprFlow 的语音输入)的需求,使用户能够完全在本地运行整个语音 I/O 循环,实现完全隐私保护且无需订阅费用。

工作原理

该应用程序整合了多个专用 AI 模型,用于不同任务:

  • 文本转语音(TTS): 集成了七种不同的 TTS 引擎(包括 Qwen3-TTS、Kokoro 和 LuxTTS),支持多语言克隆和富有表现力的语音。
  • 语音转文本(STT): 使用 OpenAI Whisper 提供高质量的转录,适用于语音输入和音频捕获。
  • 本地 LLM: 内置的 Qwen3 LLM 负责文本优化(清理语音输入中的卡顿)和「语音个性」功能,可在语音输出前将文本重写为特定角色的风格。
  • 集成: 基于 Tauri(Rust)和 FastAPI(Python)构建,提供 REST API 和 MCP(模型上下文协议)服务器,使 Claude Code 或 Cursor 等 AI 代理能够使用克隆的语音发声。

适用人群

  • 内容创作者: 使用多语音时间线编辑器制作播客、叙事或游戏对话的人。
  • 开发者: 需要本地、私有语音接口构建 AI 代理的人。
  • 无障碍用户: 需要本地运行的语音辅助工具的人。
  • 代理型 AI 用户: 使用支持 MCP 的代理,希望其 AI 助手拥有独特克隆语音的用户。

主要亮点

  • 本地优先隐私: 所有模型和语音数据均保留在用户设备上。
  • uma 7 TTS 引擎: 支持 23 种语言,可从短音频样本实现零样本语音克隆。
  • 系统级语音输入: macOS 上的全局快捷键支持推键语音输入,可直接将文本粘贴到任何聚焦的应用程序中。
  • MCP 服务器: 内置支持模型上下文协议(MCP),使 AI 代理能够触发语音输出。
  • 故事编辑器: 多轨道时间线,用于编排复杂对话和播客。
  • 音频效果: 集成后处理效果,如音高变换、混响和压缩,由 Spotify 的 pedalboard 提供支持。
  • 广泛硬件支持: 针对 Apple Silicon(MLX)、NVIDIA(CUDA)、AMD(ROCm)和 Intel Arc GPU 进行优化。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目