debpalash/VoiceStudio
VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.
解决的问题
VoiceStudio 是一个本地优先的音频工作站,无需依赖云服务订阅或 API 密钥即可实现高质量的语音克隆、配音和语音转录。它为多个 AI 音频引擎提供统一界面,使用户能够在本地硬件上完成语音生成和音频转录,数据始终保留在本地。
工作原理
该项目基于 Tauri 构建桌面外壳,前端使用 React,后端采用 FastAPI。它作为多种文本转语音(TTS)和自动语音识别(ASR)引擎(如 OmniVoice、WhisperX 和 CosyVoice)的注册中心,将请求路由到本地 GPU(CUDA、MPS、ROCm)或 CPU。同时,它还提供 OpenAI 兼容 API 和 MCP 服务器,便于与其他工具和智能体集成。
适用人群
专为需要专业音频工具的创作者、开发者以及注重隐私的用户设计,可用于语音克隆、视频配音、有声书制作和系统级语音输入,无需依赖托管服务。
主要亮点
- 本地优先工作流:默认情况下,核心音频生成和转录均在本地机器上完成。
- 广泛的引擎支持:支持 16 个 TTS 和 11 个 ASR 引擎,覆盖超过 600 种语言。
- 高级音频功能:零样本语音克隆、基于属性的语音设计,以及保留说话人特征的视频配音。
- 生产力工具:支持系统级语音输入小部件(可选本地 LLM 清理和使用 Demucs 进行人声分离)。
- 开发者友好:提供 OpenAI 兼容音频 API 和对 MCP 客户端的支持。
相关
- 项目
- 项目
sybil-solutions/local-studioLocal Studio is an open‑source macOS/desktop app that lets you run, manage, and chat with self‑hosted LLM back‑ends (vLLM, SGLang, llama.cpp, MLX). It combines a Bun + Hono controller (model lifecycle, OpenAI‑compatible proxy, GPU metrics) with a Next.js/Electron UI and an integrated Pi coding‑agent. The UI works locally or can point at a remote controller, and a companion mobile app (KittyLitter) can pair to reuse the same sessions. The repo provides full dev‑setup scripts, production build instructions, and a CI‑driven release pipeline.
- 项目
- 项目
collabora/WhisperLiveWhisperLive 是一个基于 OpenAI Whisper 模型的开源近实时语音转录服务器。支持多种推理后端(faster-whisper、NVIDIA TensorRT、Intel OpenVINO、AMD ROCm),提供单词级时间戳、热词增强、说话人分离和可选翻译功能,并提供简单的命令行客户端和 Python 流式 API。提供 GPU 和 CPU 部署的 Docker 镜像,浏览器和 iOS 扩展可让你直接从网页或移动设备转录音频。
- 项目
Blaizzy/mlx-audioMLX‑Audio 是一个 Python 库(含 CLI、Web UI 和 Swift 包),通过 MLX 框架在 Apple Silicon 上运行大量现代语音与音乐模型。支持 TTS、STT、语音转语音、语音克隆、VAD/说话人分离和音乐生成,提供 3 至 8 位量化版本以实现低内存推理。通过 `pip install mlx-audio` 安装,使用 `mlx_audio.tts.generate …` 或 Python 的 `load_model(...).generate` API 生成音频,并可选择性地提供 OpenAI 兼容 REST API。