Finrandojin/alexandria-audiobook
AI-powered multi-voice audiobook generator — LLM script annotation, voice cloning, voice design, LoRA training, per-line style control, and export to MP3, chaptered M4B, or Audacity multi-track. Built on Qwen3-TTS.
Alexandria 有聲書生成器
是什麼 – 一個可在本地執行的網頁應用程式,可將純文字書籍(.txt、.md、.epub)轉換為功能完整的有聲書。它結合 LLM 驅動的腳本註解步驟與內建的 Qwen-3 文字轉語音(TTS)引擎,讓您為每個角色分配不同的合成語音,逐行編輯腳本,並以單一 MP3、帶章節的 M4B 檔案,或 Audacity 專用的每角色 WAV 軌道格式匯出結果。
核心工作流程(5步流程)
- 設定 – 指定一個 LLM 伺服器(LM Studio、Ollama、OpenAI 或任何 OpenAI 相容 API),並選擇 TTS 模式(本地 Qwen3-TTS 或外部 Gradio 伺服器)。
- 腳本 – 上傳書籍;LLM 將其解析為 JSON 腳本,標記說話人、加入自然語音表現,並提供 TTS 指令欄位。可選的第二輪「審查」LLM 可清理歸屬錯誤。
- 聲音 – 對每個偵測到的角色,您可以:
- 從九種預訓練的自訂聲音中選擇一種。
- 從一段短參考音訊中克隆聲音。
- 使用 LoRA 微調的聲音適配器。
- 使用 VoiceDesigner 即時生成聲音(文字描述 → 合成聲音)。
- 自動生成角色:LLM 建立聲音描述,VoiceDesign 模型產生參考樣本,單擊即可將克隆聲音關聯至角色。
- 建立別名對應(例如 YOUNG ELENA → ELENA),讓多個名稱共享同一聲音。
- 編輯器 – 批次渲染所有片段(GPU 加速、子批次、可選
torch.compile提升 3-4 倍速度)。您可以聆聽、編輯文字/指令,或僅重新渲染單一片段而無需重新處理整本書。 - 結果 – 預覽完成的有聲書,然後下載:
- 一個帶自然停頓的 MP3。
- 用於有聲書播放器的帶章節 M4B 檔案。
- 包含每角色 WAV 檔案、Audacity 專案與多軌匯入標籤檔案的 ZIP 包。
重點功能
- LLM 驅動的腳本註解 – 自動說話人偵測、對話擷取與 TTS 指令生成。
- 內建 Qwen3-TTS – 本地運行(無需外部 TTS 伺服器),提供 9 種現成聲音,支援全語言(EN、ZH、FR、DE、IT、JA、KO、PT、RU、ES 或自動偵測)。
- 聲音克隆與 LoRA 訓練 – 從 5-15 秒樣本建立持久聲音身分,或透過互動式資料集建構器微調 LoRA 適配器。
- 智慧分塊與上下文保留 – 按說話人分組(≤500 字元),並保留前三個腳本項目以維持風格一致。
- 批次處理與 GPU 優化 – 子批次、平行工作執行、可選
torch.compile、NVIDIA/AMD GPU 的閃光注意力(flash-attention)。 - Web UI 編輯器 – 可編輯任意行,選擇性重新渲染,即時監看日誌,即時預覽音訊。
- 匯出彈性 – 支援 MP3、帶章節的 M4B,或 Audacity 就緒的多軌套件。
系統需求
| 組件 | 最低要求 | 推薦配置 |
|---|---|---|
| GPU | 8 GB VRAM(任何 CUDA-12.8 相容 NVIDIA,或 Linux 上的 AMD) | 批次大小舒適運行建議 16 GB+ |
| RAM | 8 GB | 16 GB |
| 磁碟 | ~20 GB(環境 + 模型權重) | – |
| 作業系統 | Windows、Linux、macOS(Apple Silicon 上僅 CPU) | – |
| 相依性 | Pinokio 平台(推薦)或 Docker、Python 3.10+、PyTorch、Qwen3-TTS 權重(每變體約 3.5 GB) | – |
安裝選項
| 方法 | 步驟 |
|---|---|
| A – Pinokio(推薦) | 1. 從 https://pinokio.computer/ 安裝 Pinokio。 2. 在 Pinokio 中點選 Install via Pinokio → 貼上 https://github.com/Finrandojin/alexandria-audiobook。3. 點選 Start – 網頁 UI 將自動開啟。 |
| B – Google Colab | 開啟提供的筆記本,提供免費 ngrok 金鑰並執行 – 系統將為您分配 T4 GPU。無需本地安裝。 |
| C – Docker(NVIDIA GPU) | ```bash |
| git clone https://github.com/Finrandojin/alexandria-audiobook.git | |
| cd alexandria-audiobook | |
| docker compose up --build | |
| ``` 於 http://localhost:4200 訪問 UI。 |
快速啟動檢查清單
- 執行 LLM 伺服器(LM Studio、Ollama 或 OpenAI),並記下其基礎 URL 和 API 金鑰。
- 透過 Pinokio/Docker/Colab 啟動 Alexandria。
- 在 Setup 頁籤中,輸入 LLM URL、金鑰與模型名稱(例如
qwen2.5-14b)。選擇 TTS 模式 =local。 - 在 Script 頁籤上傳書籍檔案,點選 Generate Annotated Script。
- (可選)點選 Review Script 以清理說話人錯誤。
- 切換至 Voices,按 Generate Personas 自動分配克隆聲音,或手動選擇/自訂聲音。
- 進入 Editor,按 Render Pending – 觀察進度條並聆聽預覽片段。
- 滿意後,點選 Merge All,再點選 Result → Download 所需格式。
如何取得協助
- Wiki – 詳細指南涵蓋聲音類型、LoRA 訓練、批次調校與故障排除。
- 終端機日誌 – Pinokio 的終端機顯示模型下載進度、VRAM 使用量與錯誤訊息。
- 常見問題 – 請參閱 Troubleshooting 頁面了解 GPU 記憶體錯誤、下載中斷與首次批次預熱延遲等問題。
授權與社群
此倉儲為開源(MIT 風格授權 – 請參閱倉儲中的 LICENSE)。歡迎透過拉取請求貢獻;接受問題回報,但維護者指出因資源有限,回應時間可能較慢。
總結 – Alexandria 將整個有聲書製作流程——LLM 腳本生成、多角色語音合成、互動式編輯與彈性匯出——整合至一個可在消費級 GPU 上執行的單一 Web UI 中。它針對愛好者、播客製作者,以及任何希望將文字轉化為精美、完整配音有聲書而不必支付商業 TTS 服務費用的人。
相關
- 專案
- 專案
- 專案
- 專案
- 專案