Finrandojin/alexandria-audiobook

AI-powered multi-voice audiobook generator — LLM script annotation, voice cloning, voice design, LoRA training, per-line style control, and export to MP3, chaptered M4B, or Audacity multi-track. Built on Qwen3-TTS.

Alexandria 有聲書生成器

是什麼 – 一個可在本地執行的網頁應用程式,可將純文字書籍(.txt、.md、.epub)轉換為功能完整的有聲書。它結合 LLM 驅動的腳本註解步驟與內建的 Qwen-3 文字轉語音(TTS)引擎,讓您為每個角色分配不同的合成語音,逐行編輯腳本,並以單一 MP3、帶章節的 M4B 檔案,或 Audacity 專用的每角色 WAV 軌道格式匯出結果。


核心工作流程(5步流程)

  1. 設定 – 指定一個 LLM 伺服器(LM Studio、Ollama、OpenAI 或任何 OpenAI 相容 API),並選擇 TTS 模式(本地 Qwen3-TTS 或外部 Gradio 伺服器)。
  2. 腳本 – 上傳書籍;LLM 將其解析為 JSON 腳本,標記說話人、加入自然語音表現,並提供 TTS 指令欄位。可選的第二輪「審查」LLM 可清理歸屬錯誤。
  3. 聲音 – 對每個偵測到的角色,您可以:
    • 從九種預訓練的自訂聲音中選擇一種。
    • 從一段短參考音訊中克隆聲音。
    • 使用 LoRA 微調的聲音適配器。
    • 使用 VoiceDesigner 即時生成聲音(文字描述 → 合成聲音)。
    • 自動生成角色:LLM 建立聲音描述,VoiceDesign 模型產生參考樣本,單擊即可將克隆聲音關聯至角色。
    • 建立別名對應(例如 YOUNG ELENA → ELENA),讓多個名稱共享同一聲音。
  4. 編輯器 – 批次渲染所有片段(GPU 加速、子批次、可選 torch.compile 提升 3-4 倍速度)。您可以聆聽、編輯文字/指令,或僅重新渲染單一片段而無需重新處理整本書。
  5. 結果 – 預覽完成的有聲書,然後下載:
    • 一個帶自然停頓的 MP3。
    • 用於有聲書播放器的帶章節 M4B 檔案。
    • 包含每角色 WAV 檔案、Audacity 專案與多軌匯入標籤檔案的 ZIP 包。

重點功能

  • LLM 驅動的腳本註解 – 自動說話人偵測、對話擷取與 TTS 指令生成。
  • 內建 Qwen3-TTS – 本地運行(無需外部 TTS 伺服器),提供 9 種現成聲音,支援全語言(EN、ZH、FR、DE、IT、JA、KO、PT、RU、ES 或自動偵測)。
  • 聲音克隆與 LoRA 訓練 – 從 5-15 秒樣本建立持久聲音身分,或透過互動式資料集建構器微調 LoRA 適配器。
  • 智慧分塊與上下文保留 – 按說話人分組(≤500 字元),並保留前三個腳本項目以維持風格一致。
  • 批次處理與 GPU 優化 – 子批次、平行工作執行、可選 torch.compile、NVIDIA/AMD GPU 的閃光注意力(flash-attention)。
  • Web UI 編輯器 – 可編輯任意行,選擇性重新渲染,即時監看日誌,即時預覽音訊。
  • 匯出彈性 – 支援 MP3、帶章節的 M4B,或 Audacity 就緒的多軌套件。

系統需求

組件 最低要求 推薦配置
GPU 8 GB VRAM(任何 CUDA-12.8 相容 NVIDIA,或 Linux 上的 AMD) 批次大小舒適運行建議 16 GB+
RAM 8 GB 16 GB
磁碟 ~20 GB(環境 + 模型權重)
作業系統 Windows、Linux、macOS(Apple Silicon 上僅 CPU)
相依性 Pinokio 平台(推薦)或 Docker、Python 3.10+、PyTorch、Qwen3-TTS 權重(每變體約 3.5 GB)

安裝選項

方法 步驟
A – Pinokio(推薦) 1. 從 https://pinokio.computer/ 安裝 Pinokio。
2. 在 Pinokio 中點選 Install via Pinokio → 貼上 https://github.com/Finrandojin/alexandria-audiobook
3. 點選 Start – 網頁 UI 將自動開啟。
B – Google Colab 開啟提供的筆記本,提供免費 ngrok 金鑰並執行 – 系統將為您分配 T4 GPU。無需本地安裝。
C – Docker(NVIDIA GPU) ```bash
git clone https://github.com/Finrandojin/alexandria-audiobook.git
cd alexandria-audiobook
docker compose up --build
```
http://localhost:4200 訪問 UI。

快速啟動檢查清單

  1. 執行 LLM 伺服器(LM Studio、Ollama 或 OpenAI),並記下其基礎 URL 和 API 金鑰。
  2. 透過 Pinokio/Docker/Colab 啟動 Alexandria
  3. Setup 頁籤中,輸入 LLM URL、金鑰與模型名稱(例如 qwen2.5-14b)。選擇 TTS 模式 = local
  4. Script 頁籤上傳書籍檔案,點選 Generate Annotated Script
  5. (可選)點選 Review Script 以清理說話人錯誤。
  6. 切換至 Voices,按 Generate Personas 自動分配克隆聲音,或手動選擇/自訂聲音。
  7. 進入 Editor,按 Render Pending – 觀察進度條並聆聽預覽片段。
  8. 滿意後,點選 Merge All,再點選 Result → Download 所需格式。

如何取得協助

  • Wiki – 詳細指南涵蓋聲音類型、LoRA 訓練、批次調校與故障排除。
  • 終端機日誌 – Pinokio 的終端機顯示模型下載進度、VRAM 使用量與錯誤訊息。
  • 常見問題 – 請參閱 Troubleshooting 頁面了解 GPU 記憶體錯誤、下載中斷與首次批次預熱延遲等問題。

授權與社群

此倉儲為開源(MIT 風格授權 – 請參閱倉儲中的 LICENSE)。歡迎透過拉取請求貢獻;接受問題回報,但維護者指出因資源有限,回應時間可能較慢。


總結 – Alexandria 將整個有聲書製作流程——LLM 腳本生成、多角色語音合成、互動式編輯與彈性匯出——整合至一個可在消費級 GPU 上執行的單一 Web UI 中。它針對愛好者、播客製作者,以及任何希望將文字轉化為精美、完整配音有聲書而不必支付商業 TTS 服務費用的人。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案