lukaszliniewicz/Pandrator

Turn PDFs and EPUBs into audiobooks; subtitles or videos into dubbed videos (including translation), and more. For free. Pandrator uses local models, including voice-cloning (instant, RVC-enhanced, XTTS fine-tuning) and LLM processing. It aspires to be a user-friendly app with a GUI, an installer and all-in-one packages.

Pandrator – ローカルファーストのオーディオブック、字幕 & 吹き替えスタジオ

概要 – Pandrator は、テキスト(書籍、PDF、Web ページなど)や既存のメディア(動画、音声ファイル)をオーディオブック、字幕、または吹き替え音声に変換できるデスクトップスタイルの Web アプリケーションです。ワークフロー全体(ドキュメントのインポート、オプションの OCR、テキストクリーニング、トランスクリプション、AI 支援による補正/翻訳、テキストから音声への生成、レビュー、エクスポート)を単一のブラウザ UI に統合しています。

重要性 – すべての重い音声およびトランスクリプションモデルをローカルで実行できるため、クラウドプロバイダを明示的に有効にしない限り、ソースドキュメントや生成された音声がコンピュータから外部に出ることはありません。これにより、プライバシーを重視するクリエイターは、永続的なインターネット接続なしで高品質の音声メディアを制作する手段を得られます。


コア機能

分野 Pandrator の機能
オーディオブック作成 TXT、PDF、EPUB、DOCX、MOBI のインポートまたはテキストの貼り付け、章の自動検出、合成用の分割、セグメントごとの音声生成、オプションでの音声変換 (RVC)、チャプターとカバーアート付きで WAV/MP3/Opus/FLAC/M4B へエクスポート。
字幕 & 吹き替え SRT(または WebVTT/ASS/SSA)または生の音声/動画の読み込み、タイムスタンプと話者分離によるトランスクリプション、字幕の並列編集/翻訳、同期した吹き替え音声の生成、字幕単独または選択可能な音声/字幕トラックを含む吹き替え動画としてのエクスポート。
音声生成 ローカル TTS モデル(例:Kokoro、Qwen3‑TTS、XTTS‑v2、VoxCPM2、Silero など)またはクラウドサービス(OpenAI、Google Gemini、ElevenLabs、カスタムエンドポイント)から選択。音声クローン、多言語音声、およびオプションの RVC 音声間変換をサポート。
AI 支援テキスト処理 オプションの LLM プロバイダを使用して、字幕の補正、用語集に対応した翻訳、ドキュメントのクリーニング、発音の最適化が可能。各 AI ステップは個別のレビュー可能なリビジョンを作成するため、何も黙って上書きされることはありません。
発音ライブラリ TTS エンジンに送信されるペイロードにのみ適用され、表示されるテキストは変更されない、決定論的でユーザーが管理する「検索と置換」ルール。
モデル管理 Pandrator Manager は音声/トランスクリプションコンポーネントをインストール、更新、削除します。変更前にコンピューティング要件、ライセンス、ダウンロードサイズを表示します。
リモート / ヘッドレス使用 サービスはデフォルトで 127.0.0.1 でリッスンしますが、LAN、VPN、またはクラウドポッドデプロイメントのためにリバースプロキシ (HTTPS) 経由で公開できます。
エージェント統合 サイドカー (pandrator‑mcp) を使用すると、MCP 互換の AI エージェントがインストールの検査、ワークフロープランの実行、クレデンシャルストア統合による限定的な回復アクションを実行できます。

はじめに(クイックスタート)

  1. Manager のダウンロード – Windows: PandratorManager‑0.9.17‑windows‑x86_64.exe、Linux: PandratorManager‑0.9.17‑x86_64.AppImage
  2. Manager を実行し、ワークスペースの親フォルダを選択して、Pandrator をインストールします。
  3. Manager が起動したブラウザ UI を開きます。
  4. Providers & services で、必要なローカルモデル(例:軽量な音声用の Kokoro、トランスクリプション用の CrispASR)をインストールします。クラウドプロバイダはオプションです。
  5. 新しいプロジェクトを作成し、ソースドキュメントまたはメディアをインポートして、ステップバイステップのパネルに従います(クリーニング → 分割 → 生成 → レビュー → エクスポート)。

技術スタック(README の記載より)

  • Python 3.11 – コアバックエンド、ワーカープロセス、CLI。
  • Node.jsweb-build Pixi 環境でロック)– ブラウザ UI を構築。
  • Pixi – Python と Node の依存関係の両方を処理し、再現可能な環境を提供するパッケージマネージャー。
  • AppImage / ネイティブ Windows exe – バンドルされたランタイム、外部 OS パッケージは不要。
  • オプションの外部ツール – URL インポート用の yt-dlp、MOBI 変換用の Calibre、credential‑stores エクストラ経由のシステムクレデンシャルストア(Windows Credential Manager、macOS Keychain、Linux Secret Service)。

典型的なユースケース

  • 自己出版の著者:テキストをクラウドサービスにアップロードせずに原稿からオーディオブックを生成したい場合。
  • 教育者 / ポッドキャスター:講義スライドや PDF のナレーションバージョンを作成する場合。
  • 動画クリエイター:正確な字幕と複数の言語でのオプションの吹き替えトラックが必要な場合。
  • プライバシーを重視するユーザー:ローカル音声モデル(例:Whisper ベースの CrispASR、XTTS)を好むが、統一された UI の利便性も引き続き望む場合。

制限事項と注意点

  • モデルサイズとハードウェア – より大きな音声クローンモデル(VoxCPM2、Fish S2 Pro)には CUDA 対応 GPU が必要です。より小さなモデルは CPU で実行できますが、遅くなります。
  • 多言語のインラインコード切り替え – 完全にはサポートされていません。外国語のセグメントを手動で分割する必要があります。
  • リモートデプロイ – 可能ですが、手動でのリバースプロキシ設定と非ループバックリスナーの明示的な有効化が必要です。
  • ElevenLabs 統合 – ネイティブ API のみ。API キーがないと検証できません。
  • 単一所有者設計 – マルチユーザー SaaS シナリオ向けには構築されていません。

ライセンスと貢献

  • コアの Pandrator コードは MIT License の下でリリースされています。サードパーティのモデルやサービスは独自のライセンスを保持しています。
  • GitHub Issues とプルリクエストを通じた貢献を歓迎します。プロジェクトでは、実用的な範囲でテストを伴う焦点を絞った変更を求めています。

結論 – Pandrator は、トランスクリプション、AI 支援テキスト処理、および最新の TTS/音声クローンモデルを単一の使いやすい Web インターフェースに統合した、本物のオープンソースでローカル実行可能なプラットフォームです。別々のツールを継ぎ接合することなく、プライバシーを保護した音声制作を必要とするクリエイターに最適です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト