estebanstifli/LocalText2Voice

A complete local production workflow for clean narration, structured learning content, and podcast-ready audio

LocalText2Voice – 是什么

LocalText2Voice 是一款免费的开源桌面应用程序,可将长篇文本(书籍、课程、文章、笔记等)转换为语音音频文件。它在 Windows 和 Linux 上运行,可完全离线使用本地安装的文本转语音(TTS)模型,也可可选调用 OpenAI、ElevenLabs、Google Gemini 或 Azure Speech 等云端 TTS 服务。


为什么重要

  • 隐私优先 – 使用本地引擎时,您的源文本永远不会离开您的计算机。
  • 无需订阅 – 所有核心功能均可使用免费下载的模型运行;云端 API 为可选。
  • 专为长篇内容设计 – 工作流支持章节、标题和大文档,将其拆分为安全的块以确保可靠生成。
  • 质量控制循环 – 可选的 Faster-Whisper 步骤可转录生成的音频,与原始文本对比,标记不匹配项以供审查或自动重试。
  • 播客就绪输出 – 叙述完成后,可添加背景音乐,应用淡入淡出、音量压制,并导出单个精炼文件。

核心工作流程(11 步)

  1. 导入文本 – 粘贴或加载 .txt、.md、*.docx 文件。
  2. 可选正则化 – 应用语言特定词典,使文本发音更友好。
  3. 智能分块 – 应用程序将文档拆分为段落感知的片段。
  4. LTV 标记(可选) – 在源文本中嵌入命令,如 {{voice "Emma"}}{{pause 900ms}}{{speed 0.9}}
  5. TTS 生成 – 选择本地引擎(Piper、Kokoro、Chatterbox、Qwen3-TTS、OmniVoice、可选 F5-TTS 俄语)或云端 API;引擎按片段运行。
  6. 清理叙述 – 生成的 WAV 文件合并为单个音频文件(M4B、MP3、M4A、Opus、FLAC、OGG)。
  7. 可选 Whisper 审查 – Faster-Whisper 转录每个片段,计算相似度/WER,并标记需审批或重试的片段。
  8. 手动/自动修复 – 编辑、重新生成或修剪有问题的片段。
  9. 字幕导出 – 使用 Whisper 时间戳生成 .srt 或卡拉OK风格的 .ass 文件。
  10. 音频混音 – 添加背景音乐,设置音量(dB)、设置开头/结尾偏移、启用音量压制,并进行响度归一化,无需重新运行 TTS。
  11. 导出 – 最终音频(及可选字幕、项目元数据、封面图)写入磁盘。

主要功能

功能 说明
模块化 TTS 引擎 支持多种本地模型(Piper、Kokoro、Chatterbox、Qwen3-TTS、OmniVoice、F5-TTS 俄语)和云端 API。模型按需下载,并在独立运行时中隔离。
语音库与克隆 浏览目录,下载 Piper 语音,或从短参考录音克隆新语音(Chatterbox、OmniVoice、F5-TTS)。
LTV 标记 内联命令,用于切换语音、语言、暂停长度、速度、音量或传递模型特定指令。
文本正则化 语言特定词典(阿拉伯语、中文、英语、…、俄语),在 TTS 前重写数字、日期、货币等。
Whisper 审查 Faster-Whisper 可转录生成音频,与源文本对比,计算相似度分数,并自动重试低质量片段。
字幕生成 生成 .srt 和逐字 .ass 文件,时间偏移正确,适用于混音。
音频混音页 添加背景音乐,控制 dB 级音量,设置开头/结尾偏移,启用音量压制,并进行响度归一化,适用于播客分发。
批量有声书 队列多个书籍,分配独立封面/音乐,支持暂停/恢复/重试,顺序生成。
项目持久化 所有项目数据(元数据、片段列表、语音选择、Whisper 分数、时间戳)存储在 SQLite 中,并通过便携式清单文件,便于重新打开或未来扩展。

支持平台与要求

  • Windows 10/11(64 位) – 官方安装包(LocalText2Voice-Setup.exe)。
  • Linux(64 位) – 从源码运行;需 Python 3.10+、虚拟环境,且 FFmpeg 在 PATH 中。
  • macOS – 尚未正式支持。
  • 硬件 – 4 核 CPU、8 GB RAM 可运行轻量级引擎;GPU(NVIDIA CUDA)为可选,但可加速 Chatterbox、Qwen3-TTS、OmniVoice 等大模型。

许可与成本

  • 应用程序 – MIT 许可证,完全免费。
  • 本地模型 – 运行免费,但每个模型遵循其上游许可证(如 OmniVoice 为 CC-BY-NC,F5-TTS 俄语为非商业 CC-BY-NC 4.0)。
  • 云端 API – 可选;使用由提供商计费。

快速入门(Windows)

  1. 发布页面 下载最新安装包。
  2. 运行安装程序,选择应用文件夹和用于 AI 资产的独立 data 文件夹。
  3. 选择设置配置文件 – CPU 轻量(Piper)或 强大 GPU(OmniVoice + Faster-Whisper)。
  4. 打开 设置 → TTS 引擎,安装所需引擎并下载语音。
  5. 粘贴或导入文本,点击 生成音频,(若启用)审查 Whisper 结果。
  6. 使用 音频混音 选项卡添加音乐并导出最终文件。

谁会使用它?

  • 作者与教育者:希望无需支付商业 TTS 服务费用即可自出版有声书或讲座录音。
  • 播客制作者:寻找一种保护隐私的方式生成叙述并混音背景音乐。
  • 开发者与爱好者:对实验开源 TTS 模型和构建自定义语音管道感兴趣的人。

总结:LocalText2Voice 将长篇文本转换为高质量语音内容的完整、以离线优先的管道,支持可选云端回退、Whisper 质量控制,以及内置播客混音工具——全部基于 MIT 许可、社区驱动的代码库。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目