debpalash/OmniVoice-Studio
Local voice clone, video dubbing, dictation and audiobook maker. The open-source ElevenLabs alternative.
What it solves
OmniVoice Studio は、ElevenLabs のようなクラウドベースの音声 AI サービスに代わる、完全にローカルで動作するオープンソースの代替手段です。すべての処理をユーザー自身のハードウェア上で実行することで、月額サブスクリプションや API キー、個人音声データを外部サーバーに送信することによるプライバシーリスクを排除します。
How it works
本ソフトウェアは、複数のテキスト・トゥ・スピーチ(TTS)エンジンと自動音声認識(ASR)エンジンを単一のデスクトップアプリに統合しています。NVIDIA CUDA、Apple Silicon MPS、Linux 上の AMD ROCm など多様なハードウェアアクセラレーションに対応し、VRAM が限られた環境では自動的に CPU へオフロードします。ユーザーは 14 種類の TTS エンジンと 11 種類の ASR エンジンから選択し、音声クローン、翻訳、文字起こしといったタスクを実行できます。
Who it’s for
クリエイター、開発者、プライバシーを重視するユーザー向けに設計されており、クラウドインフラに依存せずに、ディクテーション、オーディオブック制作、動画吹き替え、音声デザインといったプロフェッショナルレベルの音声ツールを提供します。
Highlights
- Zero-Shot Voice Cloning:3 秒の音声クリップだけで、646 言語のあらゆる声をミラーリング。
- Local Video Dubbing:動画ファイルや YouTube URL を文字起こし、翻訳、再音声化し、MP4 形式で出力するエンドツーエンドパイプライン。
- Comprehensive Audio Tools:オーディオブックエディタ(EPUB/PDF インポート、.m4b エクスポート)、マルチボイスストーリーエディタ、任意のアプリで動作するディクテーションウィジェットを含む。
- Extensive Engine Support:14 種類の TTS エンジン(例:CosyVoice、GPT-SoVITS)と 11 種類の ASR エンジン(例:WhisperX、Faster-Whisper)にアクセス可能。
- Privacy-First:100% ローカル実行で、アカウントやクラウド接続は不要。
- Integration:Claude や Cursor などの AI クライアントと連携できる MCP サーバーを同梱。