lukaszliniewicz/Pandrator

Turn PDFs and EPUBs into audiobooks; subtitles or videos into dubbed videos (including translation), and more. For free. Pandrator uses local models, including voice-cloning (instant, RVC-enhanced, XTTS fine-tuning) and LLM processing. It aspires to be a user-friendly app with a GUI, an installer and all-in-one packages.

Pandrator – 本地優先的有聲書、字幕與配音工作室

這是什麼 – Pandrator 是一款桌面風格的網頁應用程式,讓您可以將文字(書籍、PDF、網頁等)或現有媒體(影片、音訊檔案)轉換為有聲書、字幕或配音。它將整個工作流程——文件匯入、可選的 OCR、文字清理、轉錄、AI 輔助校正/翻譯、文字轉語音生成、審閱和匯出——全部整合在單一瀏覽器 UI 中。

為何重要 – 所有重量級的語音和轉錄模型都可以在本地運行,因此除非您明確啟用雲端供應商,否則您的來源文件和生成的音訊永遠不需要離開您的電腦。這為注重隱私的創作者提供了一種無需永久網路連線即可製作高品質語音媒體的方法。


核心功能

領域 Pandrator 的功能
有聲書製作 匯入 TXT、PDF、EPUB、DOCX、MOBI 或貼上文字;自動偵測章節;為合成進行分割;逐段生成語音;可選擇執行語音轉換 (RVC);匯出為 WAV/MP3/Opus/FLAC/M4B 並包含章節和封面圖片。
字幕與配音 載入 SRT(或 WebVTT/ASS/SSA)或原始音訊/影片;帶有時間戳和對話者分離進行轉錄;並排編輯/翻譯字幕;生成同步的配音語音;單獨匯出字幕或作為帶有可選音訊/字幕軌道的配音影片。
語音生成 從本地 TTS 模型(例如 Kokoro、Qwen3‑TTS、XTTS‑v2、VoxCPM2、Silero 等)或雲端服務(OpenAI、Google Gemini、ElevenLabs、自訂端點)中選擇。支援語音複製、多語言語音,以及可選的 RVC 語音對語音轉換。
AI 輔助文字處理 可選的 LLM 供應商可用於字幕校正、感知詞彙表的翻譯、文件清理和發音最佳化。每個 AI 步驟都會建立一個單獨的、可審閱的修訂版本,因此不會有任何內容被默默覆寫。
發音庫 確定性的、由使用者維護的「搜尋並取代」規則,僅應用於發送到 TTS 引擎的有效負載,保持顯示的文字不變。
模型管理 Pandrator Manager 安裝、更新和移除語音/轉錄元件。它在任何變更之前會顯示運算需求、授權和下載大小。
遠端 / 無頭使用 服務預設監聽 127.0.0.1,但可以透過反向代理 (HTTPS) 對外開放,以用於 LAN、VPN 或雲端 Pod 部署。
代理整合 一個 side‑car (pandrator‑mcp) 讓 MCP 相容的 AI 代理能夠檢查安裝、執行工作流程計畫,並透過憑證儲存整合執行有限的復原動作。

入門(快速開始)

  1. 下載 Manager – Windows:PandratorManager‑0.9.17‑windows‑x86_64.exe;Linux:PandratorManager‑0.9.17‑x86_64.AppImage
  2. 執行 Manager,為工作區挑選一個主資料夾,並讓它安裝 Pandrator。
  3. 開啟 Manager 啟動的瀏覽器 UI。
  4. Providers & services 中,安裝您需要的本地模型(例如,用於輕量級語音的 Kokoro,用於轉錄的 CrispASR)。雲端供應商是可選的。
  5. 建立一個新專案,匯入您的來源文件或媒體,並按照逐步面板操作(清理 → 分割 → 生成 → 審閱 → 匯出)。

技術堆疊(如 README 中所述)

  • Python 3.11 – 核心後端、工作程序、CLI。
  • Node.js(透過 web-build Pixi 環境鎖定)– 建構瀏覽器 UI。
  • Pixi – 套件管理員,負責處理 Python 和 Node 相依性,並提供可重現的環境。
  • AppImage / 原生 Windows exe – 套件執行階段,無需外部 OS 套件。
  • 可選的外部工具yt-dlp 用於 URL 匯入,Calibre 用於 MOBI 轉換,透過 credential‑stores 額外功能使用系統憑證儲存(Windows Credential Manager、macOS Keychain、Linux Secret Service)。

典型使用案例

  • 自出版作者,希望從手稿生成有聲書而不將文字上傳到雲端服務。
  • 教育工作者/播客製作者,製作課堂投影片或 PDF 的旁白版本。
  • 影片創作者,需要準確的字幕和多種語言的可選配音軌道。
  • 注重隱私的使用者,偏好本地語音模型(例如基於 Whisper 的 CrispASR、XTTS),但仍希望享有統一 UI 的便利性。

限制與注意事項

  • 模型大小與硬體 – 較大的語音複製模型(VoxCPM2、Fish S2 Pro)需要支援 CUDA 的 GPU;較小的模型可以在 CPU 上運行,但速度會較慢。
  • 多語言內聯程式碼切換 – 未完全支援;您必須手動分割外語段落。
  • 遠端部署 – 可能,但需要手動設定反向代理並明確啟用非回環監聽器。
  • ElevenLabs 整合 – 僅限原生 API;沒有 API 金鑰則無法驗證。
  • 單一擁有者設計 – 不適用於多使用者 SaaS 情境。

授權與貢獻

  • 核心 Pandrator 程式碼在 MIT License 下發布。第三方模型和服務保留其各自的授權。
  • 歡迎透過 GitHub Issues 和 Pull Requests 進行貢獻;專案要求進行有針對性的變更,並在可行之處附上測試。

結論 – Pandrator 是一個真正的、開源的、可在本地運行的平台,將轉錄、AI 輔助文字處理和現代 TTS/語音複製模型整合到一個單一、易於使用的網頁介面中。它非常適合需要保護隱私的音訊製作、而不需要拼湊各種獨立工具的創作者。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案