richardr1126/openreader

An open-source read-along document reader server with high-quality TTS options, synchronized highlighting, and audiobook export for EPUB, PDF, DOCX, TXT, and MD.

解決的問題

OpenReader 提供了一種可自我主機的方式,將文件(EPUB、PDF、TXT、MD 和 DOCX)轉換為同步的有聲書。它解決了需要透過文字轉語音(TTS)存取多種不同文件格式的問題,並提供精確的逐字高亮,以實現同步朗讀體驗。

工作原理

該系統使用計算工作器控制平面(基於 NATS JetStream)來處理繁重的任務。它採用基於 PP-DocLayoutV3(ONNX)的佈局感知 PDF 解析技術,實現結構化區塊檢測和跨頁拼接。在同步方面,使用 ONNX Whisper 對齊技術實現逐字高亮。音訊在背景中逐步生成,使用者可在首個音段準備就緒時立即開始收聽,而工作器則繼續處理文件的其餘部分。

適用對象

專為希望擁有私有、自我主機的文件閱讀器,並具備高品質 TTS 叙述與同步高亮功能的使用者設計,同時也適合希望將文件匯出為 M4B 或 MP3 有聲書的使用者。

主要亮點

  • 多提供者 TTS 支援:支援自主主機的 OpenAI 相容伺服器(如 Kokoro-FastAPI)或雲端 API(OpenAI、Replicate、DeepInfra)。
  • 進階播放:音訊在背景中生成,因此一旦首個音段準備就緒即可立即開始收聽。
  • 高階 PDF 解析:使用佈局感知解析,確保跨頁的精確同步朗讀。
  • 廣泛格式支援:支援 EPUB、PDF、TXT、MD 和 DOCX。
  • 有聲書匯出:可將快取的音訊組合成 M4B 或 MP3 檔案。
  • 自我主機彈性:支援 Docker、S3 相容儲存以及多種資料庫選項(SQLite 或 Postgres)。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案