jamiepine/voicebox

The open-source AI voice studio. Clone, dictate, create.

何を解決するか

Voicebox はローカル優先のAIボイススタジオで、ボイスクラーニング、音声生成、システム全体の音声入力のための統合インターフェースを提供します。ElevenLabsのようなクラウドベースの音声出力サービスや、WisprFlowのような音声入力サービスを別々に使う必要がなく、ユーザーは完全にプライベートな状態で、すべての音声I/Oループをローカルで実行でき、サブスクリプション料金も発生しません。

動作方法

アプリケーションは、さまざまなタスクに特化した複数のAIモデルを統合しています:

  • テキストから音声(TTS): Qwen3-TTS、Kokoro、LuxTTSを含む7種類のTTSエンジンを統合し、多言語のクラーニングと表現力豊かな音声を処理します。
  • 音声からテキスト(STT): OpenAI Whisperを使用して、音声入力や音声キャプチャの高品質な字幕化を実現します。
  • ローカルLLM: バンドルされたQwen3 LLMは、音声入力のつっかかりの修正や「ボイスパーソナリティ」の処理を担当します。特定のキャラクターのスタイルに合わせてテキストを再構成し、音声出力前に変換します。
  • 統合: Tauri(Rust)とFastAPI(Python)で構築されており、REST APIとMCP(Model Context Protocol)サーバーを公開しています。これにより、Claude CodeやCursorなどのAIエージェントが、クラーニングされた声を使って発話できるようになります。

対象ユーザー

  • コンテンツクリエイター: マルチボイスタイムラインエディタを使ってポッドキャスト、物語、ゲーム会話を作成する人。
  • 開発者: ローカルでプライベートな音声インターフェースが必要なAIエージェントを開発する人。
  • アクセシビリティ利用者: ローカルで動作する音声支援ツールが必要な人。
  • エージェント型AIユーザー: MCP対応エージェントを使い、AIアシスタントに独自のクラーニングされた声を持たせたい人。

特徴

  • ローカル優先のプライバシー: すべてのモデルとボイスデータはユーザーのマシン上に留まります。
  • uma 7 TTSエンジン: 23言語に対応し、短い音声サンプルからゼロショットボイスクラーニングが可能。
  • システム全体の音声入力: macOSでフォーカスされたアプリに直接テキストを貼り付けるためのグローバルホットキーによるプッシュトゥトーク音声入力。
  • MCPサーバー: Model Context Protocolの組み込みサポートにより、AIエージェントが音声出力をトリガーできるようになります。
  • ストーリー編集ツール: 複雑な会話やポッドキャストを構成するためのマルチトラックタイムライン。
  • オーディオエフェクト: Spotifyのpedalboardで駆動されるピッチシフト、リバーブ、コンプレッションなどの統合後処理エフェクト。
  • 広範なハードウェア対応: Apple Silicon(MLX)、NVIDIA(CUDA)、AMD(ROCm)、Intel Arc GPUに最適化されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト