debpalash/OmniVoice-Studio

Local voice clone, video dubbing, dictation and audiobook maker. The open-source ElevenLabs alternative.

What it solves

OmniVoice Studio 提供一个完全本地、开源的替代方案,取代像 ElevenLabs 这样的云端语音 AI 服务。它通过在用户自己的硬件上运行所有处理,消除每月订阅、API 密钥,以及将个人音频数据发送至外部服务器所带来的隐私风险。

How it works

该软件将多种文字转语音(TTS)和自动语音识别(ASR)引擎整合到单一桌面应用程序中。支持多样的硬件加速选项,包括 NVIDIA CUDA、Apple Silicon MPS 和 Linux 上的 AMD ROCm,并在 VRAM 受限的系统上自动将计算卸载到 CPU。用户可以从 14 种 TTS 引擎和 11 种 ASR 引擎中选择,执行语音克隆、翻译和转录等任务。

Who it’s for

此工具面向创作者、开发者以及注重隐私的用户,让他们在不依赖云端基础设施的情况下,获得专业级的语音工具,用于口述、电子书制作、视频配音和语音设计。

Highlights

  • Zero-Shot Voice Cloning:只需 3 秒音频片段,即可在 646 种语言中镜像任何声音。
  • Local Video Dubbing:端到端流水线,可将视频文件或 YouTube URL 转录、翻译并重新配音,输出 MP4 格式。
  • Comprehensive Audio Tools:包括电子书编辑器(支持 EPUB/PDF 导入、.m4b 导出)、多声线故事编辑器,以及可在任何应用中使用的口述小部件。
  • Extensive Engine Support:支持 14 种 TTS 引擎(如 CosyVoice、GPT-SoVITS)和 11 种 ASR 引擎(如 WhisperX、Faster-Whisper)。
  • Privacy-First:100% 本地执行,无需账户或云端连接。
  • Integration:包含 MCP 服务器,可与 Claude、Cursor 等 AI 客户端配合使用。