debpalash/VoiceStudio

VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.

解决的问题

VoiceStudio 是一个本地优先的音频工作站,无需依赖云服务订阅或 API 密钥即可实现高质量的语音克隆、配音和语音转录。它为多个 AI 音频引擎提供统一界面,使用户能够在本地硬件上完成语音生成和音频转录,数据始终保留在本地。

工作原理

该项目基于 Tauri 构建桌面外壳,前端使用 React,后端采用 FastAPI。它作为多种文本转语音(TTS)和自动语音识别(ASR)引擎(如 OmniVoice、WhisperX 和 CosyVoice)的注册中心,将请求路由到本地 GPU(CUDA、MPS、ROCm)或 CPU。同时,它还提供 OpenAI 兼容 API 和 MCP 服务器,便于与其他工具和智能体集成。

适用人群

专为需要专业音频工具的创作者、开发者以及注重隐私的用户设计,可用于语音克隆、视频配音、有声书制作和系统级语音输入,无需依赖托管服务。

主要亮点

  • 本地优先工作流:默认情况下,核心音频生成和转录均在本地机器上完成。
  • 广泛的引擎支持:支持 16 个 TTS 和 11 个 ASR 引擎,覆盖超过 600 种语言。
  • 高级音频功能:零样本语音克隆、基于属性的语音设计,以及保留说话人特征的视频配音。
  • 生产力工具:支持系统级语音输入小部件(可选本地 LLM 清理和使用 Demucs 进行人声分离)。
  • 开发者友好:提供 OpenAI 兼容音频 API 和对 MCP 客户端的支持。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目