debpalash/VoiceStudio
VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.
解決的問題
VoiceStudio 是一個以本地為先的音訊工作台,可消除高品質語音克隆、配音與語音轉錄對雲端訂閱與 API 金鑰的依賴。它提供多個 AI 音訊引擎的整合介面,讓使用者能在自家硬體上進行語音生成與音訊轉錄,資料全程保留在本地。
運作方式
本專案採用 Tauri 基礎的桌面外殼,前端使用 React,後端採用 FastAPI。它作為多種語音合成(TTS)與自動語音辨識(ASR)引擎(如 OmniVoice、WhisperX、CosyVoice)的註冊中心,將請求路由至本地 GPU(CUDA、MPS、ROCm)或 CPU。同時也提供 OpenAI 相容 API 與 MCP 伺服器,便於與其他工具與代理整合。
適用對象
專為需要專業音訊工具的創作者、開發者與重視隱私的使用者設計,可用於語音克隆、影片配音、有聲書製作與系統級語音輸入,無需依賴託管服務。
主要特色
- 本地為先的工作流程:核心音訊生成與轉錄預設於機器上執行。
- 廣泛的引擎支援:包含 16 個 TTS 與 11 個 ASR 引擎,涵蓋超過 600 種語言。
- 進階音訊功能:零樣本語音克隆、基於屬性的語音設計,以及保留講者特徵的影片配音。
- 生產力工具:支援系統級語音輸入小工具(可選本地 LLM 清理與使用 Demucs 進行人聲分離)。
- 開發者友善:提供 OpenAI 相容音訊 API 與 MCP 客戶端支援。
相關
- 專案
- 專案
sybil-solutions/local-studioLocal Studio is an open‑source macOS/desktop app that lets you run, manage, and chat with self‑hosted LLM back‑ends (vLLM, SGLang, llama.cpp, MLX). It combines a Bun + Hono controller (model lifecycle, OpenAI‑compatible proxy, GPU metrics) with a Next.js/Electron UI and an integrated Pi coding‑agent. The UI works locally or can point at a remote controller, and a companion mobile app (KittyLitter) can pair to reuse the same sessions. The repo provides full dev‑setup scripts, production build instructions, and a CI‑driven release pipeline.
- 專案
- 專案
collabora/WhisperLiveWhisperLive 是一個基於 OpenAI Whisper 模型的開源近即時語音轉錄伺服器。支援多種推論後端(faster-whisper、NVIDIA TensorRT、Intel OpenVINO、AMD ROCm),提供單字級時間戳、熱詞增強、說話人分離與可選翻譯功能,並提供簡單的命令列客戶端與 Python 流式 API。提供 GPU 與 CPU 部署的 Docker 鏡像,瀏覽器與 iOS 擴充功能可讓你直接從網頁或行動裝置轉錄音訊。
- 專案
Blaizzy/mlx-audioMLX‑Audio 是一個 Python 庫(搭配命令列、網頁介面與 Swift 套件),透過 MLX 框架在 Apple Silicon 上運行大量現代語音與音樂模型。支援 TTS、STT、語音轉語音、語音克隆、VAD/發言人辨識與音樂生成,提供 3 至 8 位元的量化版本以降低記憶體需求。使用 `pip install mlx-audio` 安裝,透過 `mlx_audio.tts.generate …` 或 Python 的 `load_model(...).generate` API 生成音訊,並可選擇性地提供 OpenAI 兼容的 REST API。