debpalash/VoiceStudio

VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.

해결하는 문제

VoiceStudio는 고품질 음성 클론, 더빙, 음성 인식을 위해 클라우드 기반 구독이나 API 키가 필요 없도록 하는 로컬 우선 오디오 워크스테이션입니다. 여러 AI 오디오 엔진을 통합한 일관된 인터페이스를 제공하여, 데이터를 사용자의 자체 하드웨어에 보관한 채 음성 생성 및 음성 인식이 가능합니다.

작동 방식

이 프로젝트는 React 프론트엔드와 FastAPI 백엔드를 갖춘 Tauri 기반 데스크톱 쉘을 사용합니다. OmniVoice, WhisperX, CosyVoice와 같은 다양한 텍스트 음성 변환(TTS) 및 음성 인식(ASR) 엔진을 레지스트리로 관리하며, 요청을 로컬 GPU(CUDA, MPS, ROCm) 또는 CPU로 라우팅합니다. 또한 OpenAI 호환 API와 다른 도구 및 에이전트와의 통합을 위한 MCP 서버도 제공합니다.

대상 사용자

호스팅된 서비스에 의존하지 않고 음성 클론, 영상 더빙, 오디오북 제작, 시스템 전체 음성 입력을 필요로 하는 크리에이터, 개발자, 개인정보 보호를 중시하는 사용자에게 적합합니다.

주요 특징

  • 로컬 우선 워크플로우: 기본적으로 핵심 오디오 생성 및 음성 인식이 기계 내부에서 수행됩니다.
  • 풍부한 엔진 지원: 16개의 TTS 및 11개의 ASR 엔진으로 600개 이상의 언어를 커버합니다.
  • 고급 오디오 기능: 제로샷 음성 클론, 속성 기반 음성 설계, 화자 보존 기능이 있는 영상 더빙.
  • 생산성 도구: 시스템 전체 음성 입력 위젯(옵션으로 로컬 LLM 정리 및 Demucs를 통한 보컬 분리 지원).
  • 개발자 친화적: OpenAI 호환 오디오 API와 MCP 클라이언트 지원을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트