debpalash/OmniVoice-Studio

Local voice clone, video dubbing, dictation and audiobook maker. The open-source ElevenLabs alternative.

What it solves

OmniVoice Studio는 ElevenLabs와 같은 클라우드 기반 음성 AI 서비스를 대체하는 완전 로컬, 오픈소스 솔루션입니다. 모든 처리를 사용자의 하드웨어에서 실행함으로써 월 구독료, API 키, 개인 오디오 데이터를 외부 서버로 전송하는 데 따른 프라이버시 위험을 없앱니다.

How it works

이 소프트웨어는 여러 텍스트‑투‑스피치(TTS) 및 자동 음성 인식(ASR) 엔진을 하나의 데스크톱 애플리케이션에 통합합니다. NVIDIA CUDA, Apple Silicon MPS, Linux의 AMD ROCm 등 다양한 하드웨어 가속 옵션을 지원하며, VRAM이 제한된 시스템에서는 자동으로 CPU로 오프로드합니다. 사용자는 14개의 TTS 엔진과 11개의 ASR 엔진 중에서 선택해 음성 클로닝, 번역, 전사 작업을 수행할 수 있습니다.

Who it’s for

크리에이터, 개발자, 프라이버시를 중시하는 사용자들을 위해 설계되었으며, 클라우드 인프라에 의존하지 않고도 디 dictation, 오디오북 제작, 비디오 더빙, 음성 디자인 등 전문 수준의 음성 도구를 제공합니다.

Highlights

  • Zero-Shot Voice Cloning: 3초짜리 오디오 클립만으로 646개 언어의 어떤 목소리든 복제합니다.
  • Local Video Dubbing: 비디오 파일이나 YouTube URL을 전사, 번역, 재음성화하여 MP4 형식으로 출력하는 엔드‑투‑엔드 파이프라인.
  • Comprehensive Audio Tools: 오디오북 편집기(EPUB/PDF 가져오기, .m4b 내보내기), 다중 음성 스토리 편집기, 모든 앱에서 동작하는 받아쓰기 위젯을 포함합니다.
  • Extensive Engine Support: 14개의 TTS 엔진(예: CosyVoice, GPT-SoVITS)과 11개의 ASR 엔진(예: WhisperX, Faster-Whisper)에 접근 가능.
  • Privacy-First: 100% 로컬 실행, 계정이나 클라우드 연결이 필요 없습니다.
  • Integration: Claude와 Cursor 같은 AI 클라이언트와 사용할 수 있는 MCP 서버를 포함합니다.