debpalash/OmniVoice-Studio

Local voice clone, video dubbing, dictation and audiobook maker. The open-source ElevenLabs alternative.

What it solves

OmniVoice Studio 提供一個完全本地、開源的替代方案,取代像 ElevenLabs 這類雲端語音 AI 服務。它透過在使用者自己的硬體上執行所有處理,消除每月訂閱、API 金鑰,以及將個人音訊資料傳送至外部伺服器所帶來的隱私風險。

How it works

此軟體將多種文字轉語音(TTS)與自動語音辨識(ASR)引擎整合於單一桌面應用程式。支援多樣的硬體加速選項,包括 NVIDIA CUDA、Apple Silicon MPS 與 Linux 上的 AMD ROCm,並在 VRAM 受限的系統上自動將運算卸載至 CPU。使用者可從 14 種 TTS 引擎與 11 種 ASR 引擎中選擇,執行語音克隆、翻譯與轉錄等任務。

Who it’s for

此工具設計給創作者、開發者與注重隱私的使用者,讓他們在不依賴雲端基礎設施的情況下,取得專業等級的語音工具,用於口述、電子書製作、影片配音與語音設計。

Highlights

  • Zero-Shot Voice Cloning:只需 3 秒音訊片段,即可在 646 種語言中鏡像任何聲音。
  • Local Video Dubbing:端到端流程,可將影片檔或 YouTube URL 轉錄、翻譯並重新配音,輸出 MP4 格式。
  • Comprehensive Audio Tools:內建電子書編輯器(支援 EPUB/PDF 匯入、.m4b 匯出)、多聲線故事編輯器,以及可在任何應用程式中使用的口述小工具。
  • Extensive Engine Support:支援 14 種 TTS 引擎(如 CosyVoice、GPT-SoVITS)與 11 種 ASR 引擎(如 WhisperX、Faster-Whisper)。
  • Privacy-First:100% 本地執行,無需帳號或雲端連線。
  • Integration:內含 MCP 伺服器,可與 Claude、Cursor 等 AI 客戶端搭配使用。