estebanstifli/LocalText2Voice

A complete local production workflow for clean narration, structured learning content, and podcast-ready audio

LocalText2Voice – 何であるか

LocalText2Voice は、長文(書籍、講義、記事、ノートなど)を音声ファイルに変換する、無料でオープンソースのデスクトップアプリケーションです。Windows および Linux で動作し、ローカルにインストールされた音声合成(TTS)モデルを使用して完全にオフラインで動作するほか、OpenAI、ElevenLabs、Google Gemini、Azure Speech などのクラウド TTS サービスをオプションで利用できます。


なぜ重要なのか

  • プライバシー最優先 – ローカルエンジンを使用すると、元のテキストはあなたのコンピュータから一切出ません。
  • サブスクリプション不要 – コア機能は無料でダウンロード可能なモデルで動作;クラウド API はオプションです。
  • 長文コンテンツ専用 – チャプター、見出し、大規模なドキュメントを処理するワークフローで、信頼性の高い生成のために安全なチャンクに分割します。
  • 品質管理ループ – オプションの Faster-Whisper ステップで生成された音声をトランスクリプトし、元のテキストと比較して不一致を検出し、レビューまたは自動再試行の対象にします。
  • ポッドキャスト対応出力 – ナレーション後、バックグラウンド音楽を追加し、フェード、ダッキング、音量正規化を適用して、1つの完成度の高いファイルとしてエクスポートできます。

コアワークフロー(11ステップ)

  1. テキストのインポート.txt、.md、*.docx ファイルを貼り付けまたは読み込み。
  2. オプションの正規化 – 語彙に応じた辞書を適用して、発音に適したテキストに変換。
  3. スマートチャンク分割 – アプリが文書を段落認識型のセグメントに分割。
  4. LTVマークアップ(オプション) – ソース内に {{voice "Emma"}}{{pause 900ms}}{{speed 0.9}} などのコマンドを埋め込み。
  5. TTS生成 – ローカルエンジン(Piper、Kokoro、Chatterbox、Qwen3-TTS、OmniVoice、オプションの F5-TTS ロシア語)またはクラウド API を選択;エンジンはセグメントごとに実行。
  6. クリーンナレーション – 生成された WAV ファイルを1つの音声ファイル(M4B、MP3、M4A、Opus、FLAC、OGG)に連結。
  7. オプションの Whisperレビュー – Faster-Whisper が各セグメントをトランスクリプトし、類似度/WER を計算し、承認または再試行の対象としてマーク。
  8. 手動/自動修正 – 問題のあるセグメントを編集、再生成、またはトリム。
  9. 字幕エクスポート – Whisper のタイムスタンプを使用して .srt またはカラオケ風 .ass ファイルを生成。
  10. オーディオミックス – TTS を再実行せずに、バックグラウンド音楽を追加し、ボリューム(dB単位)を制御、イントロ/アウトロのオフセットを設定、ダッキングを有効化、音量正規化を実施。
  11. エクスポート – 最終音声(およびオプションの字幕、プロジェクトメタデータ、カバーアート)をディスクに書き込み。

主な機能

機能 機能内容
モジュール式 TTSエンジン 多数のローカルモデル(Piper、Kokoro、Chatterbox、Qwen3-TTS、OmniVoice、F5-TTS ロシア語)とクラウド API をサポート。モデルはオンデマンドでダウンロードされ、個別のランタイムで隔離されます。
ボイスライブラリ&クローン カタログを閲覧し、Piper ボイスをダウンロード、または短いリファレンス録音から新しいボイスをクローン(Chatterbox、OmniVoice、F5-TTS)。
LTVマークアップ インラインコマンドでボイス、言語、ポーズ長、速度、ボリューム、モデル固有の指示を切り替え。
テキスト正規化 言語固有の辞書(アラビア語、中国語、英語、…、ロシア語)で、数字、日付、通貨などを TTS 前に書き換え。
Whisperレビュー Faster-Whisper が生成音声をトランスクリプトし、元のテキストと比較、類似度スコアを計算し、低品質セグメントを自動再試行。
字幕生成 .srt および単語レベルの .ass ファイルを生成し、ミックスに適した正確なオフセットを適用。
オーディオミックスページ バックグラウンド音楽を追加、dB単位でボリュームを制御、イントロ/アウトロのオフセットを設定、ダッキングを有効化、ポッドキャスト配信用に音量を正規化。
バッチオーディオブック 複数の書籍をキューに登録し、個別のカバー/音楽を割り当て、一時停止/再開/再試行をサポートして順次生成。
プロジェクト永続化 すべてのプロジェクトデータ(メタデータ、セグメントリスト、ボイス選択、Whisperスコア、タイムスタンプ)は SQLite に保存され、ポータブルなマニフェストにより再開や将来の拡張が容易。

対応プラットフォームと要件

  • Windows 10/11(64ビット) – 公式インストーラ(LocalText2Voice-Setup.exe)。
  • Linux(64ビット) – ソースから実行;Python 3.10+、仮想環境、PATH に FFmpeg が必要。
  • macOS – まだ公式サポートされていません。
  • ハードウェア – 4コア CPU、8GB RAM で軽量エンジンは動作可能;GPU(NVIDIA CUDA)はオプションですが、Chatterbox、Qwen3-TTS、OmniVoice などの大規模モデルの処理を高速化。

ライセンスとコスト

  • アプリケーション – MIT ライセンス、完全に無料。
  • ローカルモデル – 実行は無料ですが、各モデルは独自の上流ライセンスに従います(例:OmniVoice は CC-BY-NC、F5-TTS ロシア語は非営利 CC-BY-NC 4.0)。
  • クラウド API – オプション;利用は提供者による課金。

クイックスタート(Windows)

  1. リリースページから最新インストーラをダウンロード。
  2. インストーラを実行し、アプリ用フォルダと AI アセット用の別々の data フォルダを選択。
  3. セットアッププロファイルを選択 – CPU軽量(Piper)または 強力なGPU(OmniVoice + Faster-Whisper)。
  4. 設定 → TTSエンジン で、必要なエンジンをインストールし、ボイスをダウンロード。
  5. テキストを貼り付けまたはインポートし、音声生成をクリック。有効な場合、Whisperの結果をレビュー。
  6. オーディオミックスタブで音楽を追加し、最終ファイルをエクスポート。

どんな人が使うか?

  • 著者・教育者:商用TTSサービスの費用を払わずに、オーディオブックや講義録音を自作したい人。
  • ポッドキャスター:プライバシーを守りながらナレーションを生成し、音楽とミックスしたい人。
  • 開発者・趣味人:オープンソースTTSモデルを実験し、カスタムボイスパイプラインを構築したい人。

結論:LocalText2Voice は、長文を高品質な音声に変換する完全なオフライン優先パイプラインを提供し、クラウドバックアップ、Whisperによる品質管理、組み込みポッドキャストミキシングツールを備えています。すべてが MIT ライセンス、コミュニティ主導のコードベースで実現されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト