estebanstifli/LocalText2Voice
A complete local production workflow for clean narration, structured learning content, and podcast-ready audio
LocalText2Voice – 是什么
LocalText2Voice 是一款免费的开源桌面应用程序,可将长篇文本(书籍、课程、文章、笔记等)转换为语音音频文件。它在 Windows 和 Linux 上运行,可完全离线使用本地安装的文本转语音(TTS)模型,也可可选调用 OpenAI、ElevenLabs、Google Gemini 或 Azure Speech 等云端 TTS 服务。
为什么重要
- 隐私优先 – 使用本地引擎时,您的源文本永远不会离开您的计算机。
- 无需订阅 – 所有核心功能均可使用免费下载的模型运行;云端 API 为可选。
- 专为长篇内容设计 – 工作流支持章节、标题和大文档,将其拆分为安全的块以确保可靠生成。
- 质量控制循环 – 可选的 Faster-Whisper 步骤可转录生成的音频,与原始文本对比,标记不匹配项以供审查或自动重试。
- 播客就绪输出 – 叙述完成后,可添加背景音乐,应用淡入淡出、音量压制,并导出单个精炼文件。
核心工作流程(11 步)
- 导入文本 – 粘贴或加载 .txt、.md、*.docx 文件。
- 可选正则化 – 应用语言特定词典,使文本发音更友好。
- 智能分块 – 应用程序将文档拆分为段落感知的片段。
- LTV 标记(可选) – 在源文本中嵌入命令,如
{{voice "Emma"}}、{{pause 900ms}}、{{speed 0.9}}。 - TTS 生成 – 选择本地引擎(Piper、Kokoro、Chatterbox、Qwen3-TTS、OmniVoice、可选 F5-TTS 俄语)或云端 API;引擎按片段运行。
- 清理叙述 – 生成的 WAV 文件合并为单个音频文件(M4B、MP3、M4A、Opus、FLAC、OGG)。
- 可选 Whisper 审查 – Faster-Whisper 转录每个片段,计算相似度/WER,并标记需审批或重试的片段。
- 手动/自动修复 – 编辑、重新生成或修剪有问题的片段。
- 字幕导出 – 使用 Whisper 时间戳生成
.srt或卡拉OK风格的.ass文件。 - 音频混音 – 添加背景音乐,设置音量(dB)、设置开头/结尾偏移、启用音量压制,并进行响度归一化,无需重新运行 TTS。
- 导出 – 最终音频(及可选字幕、项目元数据、封面图)写入磁盘。
主要功能
| 功能 | 说明 |
|---|---|
| 模块化 TTS 引擎 | 支持多种本地模型(Piper、Kokoro、Chatterbox、Qwen3-TTS、OmniVoice、F5-TTS 俄语)和云端 API。模型按需下载,并在独立运行时中隔离。 |
| 语音库与克隆 | 浏览目录,下载 Piper 语音,或从短参考录音克隆新语音(Chatterbox、OmniVoice、F5-TTS)。 |
| LTV 标记 | 内联命令,用于切换语音、语言、暂停长度、速度、音量或传递模型特定指令。 |
| 文本正则化 | 语言特定词典(阿拉伯语、中文、英语、…、俄语),在 TTS 前重写数字、日期、货币等。 |
| Whisper 审查 | Faster-Whisper 可转录生成音频,与源文本对比,计算相似度分数,并自动重试低质量片段。 |
| 字幕生成 | 生成 .srt 和逐字 .ass 文件,时间偏移正确,适用于混音。 |
| 音频混音页 | 添加背景音乐,控制 dB 级音量,设置开头/结尾偏移,启用音量压制,并进行响度归一化,适用于播客分发。 |
| 批量有声书 | 队列多个书籍,分配独立封面/音乐,支持暂停/恢复/重试,顺序生成。 |
| 项目持久化 | 所有项目数据(元数据、片段列表、语音选择、Whisper 分数、时间戳)存储在 SQLite 中,并通过便携式清单文件,便于重新打开或未来扩展。 |
支持平台与要求
- Windows 10/11(64 位) – 官方安装包(
LocalText2Voice-Setup.exe)。 - Linux(64 位) – 从源码运行;需 Python 3.10+、虚拟环境,且 FFmpeg 在
PATH中。 - macOS – 尚未正式支持。
- 硬件 – 4 核 CPU、8 GB RAM 可运行轻量级引擎;GPU(NVIDIA CUDA)为可选,但可加速 Chatterbox、Qwen3-TTS、OmniVoice 等大模型。
许可与成本
- 应用程序 – MIT 许可证,完全免费。
- 本地模型 – 运行免费,但每个模型遵循其上游许可证(如 OmniVoice 为 CC-BY-NC,F5-TTS 俄语为非商业 CC-BY-NC 4.0)。
- 云端 API – 可选;使用由提供商计费。
快速入门(Windows)
- 从 发布页面 下载最新安装包。
- 运行安装程序,选择应用文件夹和用于 AI 资产的独立
data文件夹。 - 选择设置配置文件 – CPU 轻量(Piper)或 强大 GPU(OmniVoice + Faster-Whisper)。
- 打开 设置 → TTS 引擎,安装所需引擎并下载语音。
- 粘贴或导入文本,点击 生成音频,(若启用)审查 Whisper 结果。
- 使用 音频混音 选项卡添加音乐并导出最终文件。
谁会使用它?
- 作者与教育者:希望无需支付商业 TTS 服务费用即可自出版有声书或讲座录音。
- 播客制作者:寻找一种保护隐私的方式生成叙述并混音背景音乐。
- 开发者与爱好者:对实验开源 TTS 模型和构建自定义语音管道感兴趣的人。
总结:LocalText2Voice 将长篇文本转换为高质量语音内容的完整、以离线优先的管道,支持可选云端回退、Whisper 质量控制,以及内置播客混音工具——全部基于 MIT 许可、社区驱动的代码库。
相关
- 项目
- 项目
- 项目
- 项目
- 项目