debpalash/VoiceStudio
VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.
何を解決するか
VoiceStudio は、高品質な音声クローン、ダブリング、音声認識に必要なクラウドベースのサブスクリプションやAPIキーを不要にする、ローカルファーストのオーディオワークステーションです。複数のAIオーディオエンジンを統合したインターフェースを提供し、データを自宅のハードウェア上に保持したまま、音声生成や音声認識が可能になります。
動作方法
このプロジェクトは、ReactフロントエンドとFastAPIバックエンドを備えたTauriベースのデスクトップシェルを使用しています。OmniVoice、WhisperX、CosyVoiceなどのテキストから音声(TTS)および音声認識(ASR)エンジンをレジストリとして管理し、ローカルGPU(CUDA、MPS、ROCm)またはCPUにリクエストをルーティングします。また、OpenAI互換APIとMCPサーバーも提供し、他のツールやエージェントとの統合を可能にしています。
対象ユーザー
プロフェッショナルなオーディオツールを必要とするクリエイター、開発者、プライバシーを重視するユーザー向けです。ホストされたサービスに依存せずに、音声クローン、動画ダブリング、オーディオブック制作、システム全体の音声入力が可能です。
主な特徴
- ローカルファーストのワークフロー:デフォルトでコアのオーディオ生成と音声認識がマシン上で実行されます。
- 広範なエンジン対応:16のTTSエンジンと11のASRエンジンを搭載し、600語以上に対応しています。
- 高度なオーディオ機能:ゼロショット音声クローン、属性に基づく音声設計、話者を保持した動画ダブリング。
- 生産性ツール:システム全体の音声入力ウィジェット(オプションでローカルLLMによるクリーニングとDemucsによるボーカル分離をサポート)。
- 開発者向け:OpenAI互換のオーディオAPIとMCPクライアントのサポートを提供しています。
関連
- プロジェクト
jamiepine/voiceboxローカル優先のオープンソースAIボイススタジオで、ボイスクラーニング、音声生成、システム全体の音声入力に対応。AIエージェント統合のためのMCPサーバーを備えています。
- プロジェクト
sybil-solutions/local-studioLocal Studio is an open‑source macOS/desktop app that lets you run, manage, and chat with self‑hosted LLM back‑ends (vLLM, SGLang, llama.cpp, MLX). It combines a Bun + Hono controller (model lifecycle, OpenAI‑compatible proxy, GPU metrics) with a Next.js/Electron UI and an integrated Pi coding‑agent. The UI works locally or can point at a remote controller, and a companion mobile app (KittyLitter) can pair to reuse the same sessions. The repo provides full dev‑setup scripts, production build instructions, and a CI‑driven release pipeline.
- プロジェクト
- プロジェクト
collabora/WhisperLiveWhisperLiveは、OpenAIのWhisperモデルを基盤としたオープンソースのニアリアルタイム音声認識サーバーです。複数の推論バックエンド(faster-whisper、NVIDIA TensorRT、Intel OpenVINO、AMD ROCm)をサポートし、単語レベルのタイムスタンプ、ホットワード強調、話者分離、オプションの翻訳機能を提供。シンプルなコマンドラインクライアントとPythonストリーミングAPIを備え、GPUおよびCPU用のDockerイメージを提供。ブラウザやiOS拡張機能により、ウェブページやモバイルデバイスから直接音声を認識できます。
- プロジェクト
Blaizzy/mlx-audioMLX‑Audio は、MLX フレームワークを介して Apple Silicon(Mシリーズ)上で多数の最新音声・音楽モデルを実行できる Python ライブラリ(CLI、Web UI、Swift パッケージ付き)です。TTS、STT、音声から音声、音声クローン、VAD/話者分離、音楽生成をサポートし、低メモリ推論用に 3〜8ビットの量子化バリアントを提供します。`pip install mlx-audio` でインストールでき、`mlx_audio.tts.generate …` または Python の `load_model(...).generate` API で音声を生成可能。OpenAI互換 REST API もオプションで提供します。