debpalash/VoiceStudio

VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.

何を解決するか

VoiceStudio は、高品質な音声クローン、ダブリング、音声認識に必要なクラウドベースのサブスクリプションやAPIキーを不要にする、ローカルファーストのオーディオワークステーションです。複数のAIオーディオエンジンを統合したインターフェースを提供し、データを自宅のハードウェア上に保持したまま、音声生成や音声認識が可能になります。

動作方法

このプロジェクトは、ReactフロントエンドとFastAPIバックエンドを備えたTauriベースのデスクトップシェルを使用しています。OmniVoice、WhisperX、CosyVoiceなどのテキストから音声(TTS)および音声認識(ASR)エンジンをレジストリとして管理し、ローカルGPU(CUDA、MPS、ROCm)またはCPUにリクエストをルーティングします。また、OpenAI互換APIとMCPサーバーも提供し、他のツールやエージェントとの統合を可能にしています。

対象ユーザー

プロフェッショナルなオーディオツールを必要とするクリエイター、開発者、プライバシーを重視するユーザー向けです。ホストされたサービスに依存せずに、音声クローン、動画ダブリング、オーディオブック制作、システム全体の音声入力が可能です。

主な特徴

  • ローカルファーストのワークフロー:デフォルトでコアのオーディオ生成と音声認識がマシン上で実行されます。
  • 広範なエンジン対応:16のTTSエンジンと11のASRエンジンを搭載し、600語以上に対応しています。
  • 高度なオーディオ機能:ゼロショット音声クローン、属性に基づく音声設計、話者を保持した動画ダブリング。
  • 生産性ツール:システム全体の音声入力ウィジェット(オプションでローカルLLMによるクリーニングとDemucsによるボーカル分離をサポート)。
  • 開発者向け:OpenAI互換のオーディオAPIとMCPクライアントのサポートを提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト