richardr1126/openreader
An open-source read-along document reader server with high-quality TTS options, synchronized highlighting, and audiobook export for EPUB, PDF, DOCX, TXT, and MD.
解決的問題
OpenReader 提供了一種可自我主機的方式,將文件(EPUB、PDF、TXT、MD 和 DOCX)轉換為同步的有聲書。它解決了需要透過文字轉語音(TTS)存取多種不同文件格式的問題,並提供精確的逐字高亮,以實現同步朗讀體驗。
工作原理
該系統使用計算工作器控制平面(基於 NATS JetStream)來處理繁重的任務。它採用基於 PP-DocLayoutV3(ONNX)的佈局感知 PDF 解析技術,實現結構化區塊檢測和跨頁拼接。在同步方面,使用 ONNX Whisper 對齊技術實現逐字高亮。音訊在背景中逐步生成,使用者可在首個音段準備就緒時立即開始收聽,而工作器則繼續處理文件的其餘部分。
適用對象
專為希望擁有私有、自我主機的文件閱讀器,並具備高品質 TTS 叙述與同步高亮功能的使用者設計,同時也適合希望將文件匯出為 M4B 或 MP3 有聲書的使用者。
主要亮點
- 多提供者 TTS 支援:支援自主主機的 OpenAI 相容伺服器(如 Kokoro-FastAPI)或雲端 API(OpenAI、Replicate、DeepInfra)。
- 進階播放:音訊在背景中生成,因此一旦首個音段準備就緒即可立即開始收聽。
- 高階 PDF 解析:使用佈局感知解析,確保跨頁的精確同步朗讀。
- 廣泛格式支援:支援 EPUB、PDF、TXT、MD 和 DOCX。
- 有聲書匯出:可將快取的音訊組合成 M4B 或 MP3 檔案。
- 自我主機彈性:支援 Docker、S3 相容儲存以及多種資料庫選項(SQLite 或 Postgres)。
相關
- 專案
- 專案
- 專案
- 專案
- 專案