denizsafak/abogen
Generate audiobooks from EPUBs, PDFs and text with synchronized captions.
解决的问题
Abogen 是一款文本转语音 (TTS) 工具,旨在将长文档(如 ePub、PDF、文本文件和 markdown)转换为具有完美同步字幕的高质量有声书或配音。它消除了为 TTS 生成而手动调整字幕时间轴和管理长文本的繁琐工作。
工作原理
该工具利用 Kokoro-82M 模型进行自然语音合成。它提供两种不同的界面:用于稳定核心功能的 PyQt6 桌面应用程序,以及用于高级功能的基于 Flask 的 Web UI。它支持广泛的输入格式(ePub, PDF, TXT, MD, SRT, ASS, VTT),并可以以 WAV、MP3 和 M4B(带章节)等多种格式输出音频。
适用对象
适用于制作有声书、社交媒体(Instagram, YouTube, TikTok)配音的创作者,以及希望将数字阅读材料转换为音频格式的用户。
亮点
- 多格式支持:处理 ePub、PDF 和 markdown 文件,包括针对电子书的章节感知处理。
- 自定义语音混合:语音混合器允许用户通过以可调节权重混合不同的语音模型来创建独特的嗓音。
- 灵活的字幕生成:提供多种字幕样式(按句子、单词或高亮显示)和格式(SRT, ASS)。
- Cuda/ROCm 支持:针对 NVIDIA 和 AMD GPU 进行了优化,以确保快速的处理速度。
- 高级 Web UI:包含基于 LLM 的文本规范化和 Audiobookshelf 集成等附加功能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目