debpalash/VoiceStudio
VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.
해결하는 문제
VoiceStudio는 고품질 음성 클론, 더빙, 음성 인식을 위해 클라우드 기반 구독이나 API 키가 필요 없도록 하는 로컬 우선 오디오 워크스테이션입니다. 여러 AI 오디오 엔진을 통합한 일관된 인터페이스를 제공하여, 데이터를 사용자의 자체 하드웨어에 보관한 채 음성 생성 및 음성 인식이 가능합니다.
작동 방식
이 프로젝트는 React 프론트엔드와 FastAPI 백엔드를 갖춘 Tauri 기반 데스크톱 쉘을 사용합니다. OmniVoice, WhisperX, CosyVoice와 같은 다양한 텍스트 음성 변환(TTS) 및 음성 인식(ASR) 엔진을 레지스트리로 관리하며, 요청을 로컬 GPU(CUDA, MPS, ROCm) 또는 CPU로 라우팅합니다. 또한 OpenAI 호환 API와 다른 도구 및 에이전트와의 통합을 위한 MCP 서버도 제공합니다.
대상 사용자
호스팅된 서비스에 의존하지 않고 음성 클론, 영상 더빙, 오디오북 제작, 시스템 전체 음성 입력을 필요로 하는 크리에이터, 개발자, 개인정보 보호를 중시하는 사용자에게 적합합니다.
주요 특징
- 로컬 우선 워크플로우: 기본적으로 핵심 오디오 생성 및 음성 인식이 기계 내부에서 수행됩니다.
- 풍부한 엔진 지원: 16개의 TTS 및 11개의 ASR 엔진으로 600개 이상의 언어를 커버합니다.
- 고급 오디오 기능: 제로샷 음성 클론, 속성 기반 음성 설계, 화자 보존 기능이 있는 영상 더빙.
- 생산성 도구: 시스템 전체 음성 입력 위젯(옵션으로 로컬 LLM 정리 및 Demucs를 통한 보컬 분리 지원).
- 개발자 친화적: OpenAI 호환 오디오 API와 MCP 클라이언트 지원을 제공합니다.
관련
- 프로젝트
jamiepine/voicebox로컬 우선의 오픈소스 AI 음성 스튜디오로, 음성 클로닝, 음성 생성, 시스템 전체 사전 입력을 지원하며, AI 에이전트 통합을 위한 MCP 서버를 갖추고 있습니다.
- 프로젝트
sybil-solutions/local-studioLocal Studio is an open‑source macOS/desktop app that lets you run, manage, and chat with self‑hosted LLM back‑ends (vLLM, SGLang, llama.cpp, MLX). It combines a Bun + Hono controller (model lifecycle, OpenAI‑compatible proxy, GPU metrics) with a Next.js/Electron UI and an integrated Pi coding‑agent. The UI works locally or can point at a remote controller, and a companion mobile app (KittyLitter) can pair to reuse the same sessions. The repo provides full dev‑setup scripts, production build instructions, and a CI‑driven release pipeline.
- 프로젝트
- 프로젝트
collabora/WhisperLiveWhisperLive는 OpenAI의 Whisper 모델을 기반으로 한 오픈소스의 실시간 가까운 음성 인식 서버입니다. 여러 추론 백엔드(faster-whisper, NVIDIA TensorRT, Intel OpenVINO, AMD ROCm)를 지원하며, 단어 수준 타임스탬프, 핫워드 강조, 스피커 다이어리제이션 및 선택적 번역 기능을 제공합니다. 간단한 명령줄 클라이언트와 Python 스트리밍 API를 제공하며, GPU 및 CPU용 Docker 이미지를 제공합니다. 브라우저 및 iOS 확장 기능을 통해 웹 페이지나 모바일 기기에서 직접 오디오를 인식할 수 있습니다.
- 프로젝트
Blaizzy/mlx-audioMLX‑Audio는 MLX 프레임워크를 통해 Apple Silicon(M-시리즈)에서 현대 음성 및 음악 모델의 대규모 컬렉션을 실행할 수 있는 Python 라이브러리(CLI, 웹 UI, Swift 패키지 포함)입니다. TTS, STT, 음성-음성 변환, 음성 클로닝, VAD/화자 분리, 음악 생성을 지원하며, 저메모리 추론을 위한 3~8비트 양자화 버전을 제공합니다. `pip install mlx-audio`로 설치하고, `mlx_audio.tts.generate …` 또는 Python의 `load_model(...).generate` API로 오디오를 생성할 수 있으며, OpenAI 호환 REST API도 옵션으로 제공합니다.