debpalash/OmniVoice-Studio

Local voice clone, video dubbing, dictation and audiobook maker. The open-source ElevenLabs alternative.

What it solves

OmniVoice Studio は、ElevenLabs のようなクラウドベースの音声 AI サービスに代わる、完全にローカルで動作するオープンソースの代替手段です。すべての処理をユーザー自身のハードウェア上で実行することで、月額サブスクリプションや API キー、個人音声データを外部サーバーに送信することによるプライバシーリスクを排除します。

How it works

本ソフトウェアは、複数のテキスト・トゥ・スピーチ(TTS)エンジンと自動音声認識(ASR)エンジンを単一のデスクトップアプリに統合しています。NVIDIA CUDA、Apple Silicon MPS、Linux 上の AMD ROCm など多様なハードウェアアクセラレーションに対応し、VRAM が限られた環境では自動的に CPU へオフロードします。ユーザーは 14 種類の TTS エンジンと 11 種類の ASR エンジンから選択し、音声クローン、翻訳、文字起こしといったタスクを実行できます。

Who it’s for

クリエイター、開発者、プライバシーを重視するユーザー向けに設計されており、クラウドインフラに依存せずに、ディクテーション、オーディオブック制作、動画吹き替え、音声デザインといったプロフェッショナルレベルの音声ツールを提供します。

Highlights

  • Zero-Shot Voice Cloning:3 秒の音声クリップだけで、646 言語のあらゆる声をミラーリング。
  • Local Video Dubbing:動画ファイルや YouTube URL を文字起こし、翻訳、再音声化し、MP4 形式で出力するエンドツーエンドパイプライン。
  • Comprehensive Audio Tools:オーディオブックエディタ(EPUB/PDF インポート、.m4b エクスポート)、マルチボイスストーリーエディタ、任意のアプリで動作するディクテーションウィジェットを含む。
  • Extensive Engine Support:14 種類の TTS エンジン(例:CosyVoice、GPT-SoVITS)と 11 種類の ASR エンジン(例:WhisperX、Faster-Whisper)にアクセス可能。
  • Privacy-First:100% ローカル実行で、アカウントやクラウド接続は不要。
  • Integration:Claude や Cursor などの AI クライアントと連携できる MCP サーバーを同梱。