estebanstifli/LocalText2Voice
A complete local production workflow for clean narration, structured learning content, and podcast-ready audio
LocalText2Voice – 是什麼
LocalText2Voice 是一款免費的開源桌面應用程式,可將長篇文字(書籍、課程、文章、筆記等)轉換為語音音訊檔案。它在 Windows 與 Linux 上運作,可完全離線使用本地安裝的語音合成(TTS)模型,亦可選擇性呼叫 OpenAI、ElevenLabs、Google Gemini 或 Azure Speech 等雲端 TTS 服務。
為何重要
- 隱私優先 – 使用本地引擎時,您的原始文字永遠不會離開您的電腦。
- 無需訂閱 – 所有核心功能皆可使用免費下載的模型運作;雲端 API 為可選。
- 專為長篇內容設計 – 工作流程支援章節、標題與大文件,自動拆分為安全的區塊以確保可靠生成。
- 品質控制迴圈 – 可選的 Faster-Whisper 步驟可轉錄生成的音訊,與原始文字比對,標記不一致項目以供審查或自動重試。
- 播客就緒輸出 – 叙述完成後,可加入背景音樂,套用淡入淡出、音量壓制,並匯出單一精緻檔案。
核心工作流程(11 步)
- 匯入文字 – 貼上或載入 .txt、.md、*.docx 檔案。
- 可選正規化 – 套用語言特定詞典,使文字發音更自然。
- 智慧分塊 – 應用程式將文件拆分成段落感知的片段。
- LTV 標記(可選) – 在原始文字中嵌入指令,如
{{voice "Emma"}}、{{pause 900ms}}、{{speed 0.9}}。 - TTS 生成 – 選擇本地引擎(Piper、Kokoro、Chatterbox、Qwen3-TTS、OmniVoice、可選 F5-TTS 俄語)或雲端 API;引擎依片段運行。
- 清潔敘述 – 生成的 WAV 檔案合併為單一音訊檔案(M4B、MP3、M4A、Opus、FLAC、OGG)。
- 可選 Whisper 審查 – Faster-Whisper 轉錄每個片段,計算相似度/WER,並標記需審核或重試的片段。
- 手動/自動修復 – 編輯、重新生成或修剪問題片段。
- 字幕匯出 – 使用 Whisper 時間戳生成
.srt或卡拉OK風格的.ass檔案。 - 音訊混音 – 加入背景音樂,設定音量(dB)、開頭/結尾偏移、啟用音量壓制,並進行音量歸一化,無需重新執行 TTS。
- 匯出 – 最終音訊(及可選字幕、專案元資料、封面圖)寫入磁碟。
主要功能
| 功能 | 說明 |
|---|---|
| 模組化 TTS 引擎 | 支援多種本地模型(Piper、Kokoro、Chatterbox、Qwen3-TTS、OmniVoice、F5-TTS 俄語)與雲端 API。模型按需下載,並在獨立執行環境中隔離。 |
| 語音圖書館與克隆 | 浏覽目錄,下載 Piper 語音,或從短參考錄音克隆新語音(Chatterbox、OmniVoice、F5-TTS)。 |
| LTV 標記 | 內嵌指令,用於切換語音、語言、停頓長度、速度、音量或傳遞模型特定指令。 |
| 文字正規化 | 語言特定詞典(阿拉伯語、中文、英文、…、俄語),於 TTS 前重寫數字、日期、貨幣等。 |
| Whisper 審查 | Faster-Whisper 可轉錄生成音訊,與原始文字比對,計算相似度分數,並自動重試低品質片段。 |
| 字幕生成 | 產生 .srt 與逐字 .ass 檔案,時間偏移正確,適用於混音。 |
| 音訊混音頁 | 加入背景音樂,控制 dB 級音量,設定開頭/結尾偏移,啟用音量壓制,並進行音量歸一化,適用於播客分發。 |
| 批量有聲書 | 排隊多本著作,分配獨立封面/音樂,支援暫停/恢復/重試,依序生成。 |
| 專案持久化 | 所有專案資料(元資料、片段清單、語音選擇、Whisper 分數、時間戳)儲存在 SQLite 中,並透過可攜式清單文件,方便重新開啟或未來擴充。 |
支援平台與需求
- Windows 10/11(64 位) – 官方安裝程式(
LocalText2Voice-Setup.exe)。 - Linux(64 位) – 從原始碼執行;需 Python 3.10+、虛擬環境,且 FFmpeg 在
PATH中。 - macOS – 尚未正式支援。
- 硬體 – 4 核 CPU、8 GB RAM 可運行輕量級引擎;GPU(NVIDIA CUDA)為可選,但可加速 Chatterbox、Qwen3-TTS、OmniVoice 等大型模型。
授權與成本
- 應用程式 – MIT 授權,完全免費。
- 本地模型 – 運行免費,但每個模型遵循其上游授權(如 OmniVoice 為 CC-BY-NC,F5-TTS 俄語為非商業 CC-BY-NC 4.0)。
- 雲端 API – 可選;使用由提供者計費。
快速入門(Windows)
- 從 發行頁面 下載最新安裝程式。
- 執行安裝程式,選擇應用程式資料夾與獨立的
data資料夾存放 AI 資產。 - 選擇設定配置檔 – CPU 輕量(Piper)或 強大 GPU(OmniVoice + Faster-Whisper)。
- 開啟 設定 → TTS 引擎,安裝所需引擎並下載語音。
- 貼上或匯入文字,點選 產生音訊,(若啟用)審查 Whisper 結果。
- 使用 音訊混音 頁籤加入音樂並匯出最終檔案。
誰會使用它?
- 作者與教育者:希望無需支付商業 TTS 服務費用即可自出版有聲書或講義錄音。
- 播客製作者:尋找一種保護隱私的方式生成敘述並與音樂混音。
- 開發者與愛好者:對實驗開源 TTS 模型與建構自訂語音管道感興趣的人。
總結:LocalText2Voice 提供完整的離線優先管道,將長篇文字轉換為高品質語音內容,支援可選雲端備援、Whisper 質量控制,以及內建播客混音工具——全部基於 MIT 授權、社群驅動的程式碼庫。
相關
- 專案
- 專案
- 專案
- 專案
- 專案