lukaszliniewicz/Pandrator

Turn PDFs and EPUBs into audiobooks; subtitles or videos into dubbed videos (including translation), and more. For free. Pandrator uses local models, including voice-cloning (instant, RVC-enhanced, XTTS fine-tuning) and LLM processing. It aspires to be a user-friendly app with a GUI, an installer and all-in-one packages.

Pandrator – 本地优先的有声书、字幕与配音工作室

这是什么 – Pandrator 是一款桌面风格的 Web 应用程序,可让您将文本(书籍、PDF、网页等)或现有媒体(视频、音频文件)转换为有声书、字幕或配音。它将整个工作流程——文档导入、可选的 OCR、文本清理、转录、AI 辅助校正/翻译、文本转语音生成、审阅和导出——全部整合在单一浏览器 UI 中。

为何重要 – 所有重量级的语音和转录模型都可以在本地运行,因此除非您明确启用云提供商,否则您的源文档和生成的音频永远不需要离开您的计算机。这为注重隐私的创作者提供了一种无需永久互联网连接即可制作高质量语音媒体的方法。


核心功能

领域 Pandrator 的功能
有声书制作 导入 TXT、PDF、EPUB、DOCX、MOBI 或粘贴文本;自动检测章节;为合成进行分割;逐段生成语音;可选择运行语音转换 (RVC);导出为 WAV/MP3/Opus/FLAC/M4B 并包含章节和封面图片。
字幕与配音 加载 SRT(或 WebVTT/ASS/SSA)或原始音频/视频;带有时间戳和说话人分离进行转录;并排编辑/翻译字幕;生成同步的配音语音;单独导出字幕或作为带有可选音频/字幕轨道的配音视频。
语音生成 从本地 TTS 模型(例如 Kokoro、Qwen3‑TTS、XTTS‑v2、VoxCPM2、Silero 等)或云服务(OpenAI、Google Gemini、ElevenLabs、自定义端点)中选择。支持语音克隆、多语言语音,以及可选的 RVC 语音对语音转换。
AI 辅助文本处理 可选的 LLM 提供商可用于字幕校正、感知词汇表的翻译、文档清理和发音优化。每个 AI 步骤都会创建一个单独的、可审阅的修订版本,因此不会有任何内容被默默覆盖。
发音库 确定性的、由用户维护的“查找并替换”规则,仅应用于发送到 TTS 引擎的有效负载,保持显示的文本不变。
模型管理 Pandrator Manager 安装、更新和移除语音/转录组件。它在任何更改之前会显示计算要求、许可证和下载大小。
远程 / 无头使用 服务默认监听 127.0.0.1,但可以通过反向代理 (HTTPS) 暴露,以用于 LAN、VPN 或云 Pod 部署。
代理集成 一个 side‑car (pandrator‑mcp) 让 MCP 兼容的 AI 代理能够检查安装、运行工作流计划,并通过凭据存储集成执行有限的恢复操作。

入门(快速开始)

  1. 下载 Manager – Windows:PandratorManager‑0.9.17‑windows‑x86_64.exe;Linux:PandratorManager‑0.9.17‑x86_64.AppImage
  2. 运行 Manager,为工作区挑选一个主文件夹,并让它安装 Pandrator。
  3. 打开 Manager 启动的浏览器 UI。
  4. Providers & services 中,安装您需要的本地模型(例如,用于轻量级语音的 Kokoro,用于转录的 CrispASR)。云提供商是可选的。
  5. 创建一个新项目,导入您的源文档或媒体,并按照分步面板操作(清理 → 分割 → 生成 → 审阅 → 导出)。

技术栈(如 README 中所述)

  • Python 3.11 – 核心后端、工作进程、CLI。
  • Node.js(通过 web-build Pixi 环境锁定)– 构建浏览器 UI。
  • Pixi – 包管理器,负责处理 Python 和 Node 依赖项,并提供可重现的环境。
  • AppImage / 原生 Windows exe – 捆绑运行时,无需外部 OS 包。
  • 可选的外部工具yt-dlp 用于 URL 导入,Calibre 用于 MOBI 转换,通过 credential‑stores 额外功能使用系统凭据存储(Windows Credential Manager、macOS Keychain、Linux Secret Service)。

典型用例

  • 自出版作者,希望从手稿生成有声书而不将文本上传到云服务。
  • 教育工作者/播客制作者,制作课堂幻灯片或 PDF 的旁白版本。
  • 视频创作者,需要准确的字幕和多种语言的可选配音轨道。
  • 注重隐私的用户,偏好本地语音模型(例如基于 Whisper 的 CrispASR、XTTS),但仍希望享有统一 UI 的便利性。

限制与注意事项

  • 模型大小与硬件 – 较大的语音克隆模型(VoxCPM2、Fish S2 Pro)需要支持 CUDA 的 GPU;较小的模型可以在 CPU 上运行,但速度会较慢。
  • 多语言内联代码切换 – 未完全支持;您必须手动分割外语段落。
  • 远程部署 – 可能,但需要手动配置反向代理并显式启用非环回监听器。
  • ElevenLabs 集成 – 仅限原生 API;没有 API 密钥则无法验证。
  • 单一所有者设计 – 不适用于多用户 SaaS 场景。

许可证与贡献

  • 核心 Pandrator 代码在 MIT License 下发布。第三方模型和服务保留其各自的许可证。
  • 欢迎通过 GitHub Issues 和 Pull Requests 进行贡献;项目要求进行有针对性的更改,并在可行之处附上测试。

结论 – Pandrator 是一个真正的、开源的、可在本地运行的平台,将转录、AI 辅助文本处理和现代 TTS/语音克隆模型整合到一个单一、易于使用的 Web 界面中。它非常适合需要保护隐私的音频制作、而不需要拼凑各种独立工具的创作者。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目