debpalash/VoiceStudio

VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.

解決的問題

VoiceStudio 是一個以本地為先的音訊工作台,可消除高品質語音克隆、配音與語音轉錄對雲端訂閱與 API 金鑰的依賴。它提供多個 AI 音訊引擎的整合介面,讓使用者能在自家硬體上進行語音生成與音訊轉錄,資料全程保留在本地。

運作方式

本專案採用 Tauri 基礎的桌面外殼,前端使用 React,後端採用 FastAPI。它作為多種語音合成(TTS)與自動語音辨識(ASR)引擎(如 OmniVoice、WhisperX、CosyVoice)的註冊中心,將請求路由至本地 GPU(CUDA、MPS、ROCm)或 CPU。同時也提供 OpenAI 相容 API 與 MCP 伺服器,便於與其他工具與代理整合。

適用對象

專為需要專業音訊工具的創作者、開發者與重視隱私的使用者設計,可用於語音克隆、影片配音、有聲書製作與系統級語音輸入,無需依賴託管服務。

主要特色

  • 本地為先的工作流程:核心音訊生成與轉錄預設於機器上執行。
  • 廣泛的引擎支援:包含 16 個 TTS 與 11 個 ASR 引擎,涵蓋超過 600 種語言。
  • 進階音訊功能:零樣本語音克隆、基於屬性的語音設計,以及保留講者特徵的影片配音。
  • 生產力工具:支援系統級語音輸入小工具(可選本地 LLM 清理與使用 Demucs 進行人聲分離)。
  • 開發者友善:提供 OpenAI 相容音訊 API 與 MCP 客戶端支援。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案