richardr1126/openreader
An open-source read-along document reader server with high-quality TTS options, synchronized highlighting, and audiobook export for EPUB, PDF, DOCX, TXT, and MD.
해결하는 문제
OpenReader는 EPUB, PDF, TXT, MD, DOCX 문서를 동기화된 오디오북으로 변환할 수 있는 자체 호스팅 가능한 방법을 제공합니다. 다양한 문서 형식을 텍스트 음성 변환(TTS)으로 접근하고, 독서 경험을 위한 정확한 단어 단위 하이라이트를 제공하는 문제를 해결합니다.
작동 방식
시스템은 NATS JetStream을 백엔드로 사용하는 컴퓨트 워커 제어 플레인을 사용하여 무거운 작업을 처리합니다. 구조화된 블록 탐지 및 페이지 간 연결을 위해 PP-DocLayoutV3(ONNX)를 활용한 레이아웃 인식 PDF 파싱을 사용합니다. 동기화를 위해 ONNX Whisper 정렬을 사용하여 단어 단위 하이라이트를 달성합니다. 오디오는 백그라운드에서 점진적으로 생성되므로, 첫 번째 세그먼트가 준비되는 즉시 듣기 시작할 수 있습니다. 워커는 문서의 나머지 부분을 계속 처리합니다.
대상 사용자
고품질 TTS 내레이션과 동기화된 하이라이트를 원하는 개인적인 자기 호스팅 문서 리더를 원하는 사용자, 또는 문서를 M4B 또는 MP3 오디오북으로 내보내고 싶은 사용자에게 적합합니다.
주요 기능
- 다중 제공자 TTS 지원: 자체 호스팅 가능한 OpenAI 호환 서버(예: Kokoro-FastAPI) 또는 클라우드 API(OpenAI, Replicate, DeepInfra)와 호환됩니다.
- 진행형 재생: 오디오가 백그라운드에서 생성되므로 첫 번째 세그먼트가 준비되는 즉시 듣기 시작할 수 있습니다.
- 고급 PDF 파싱: 레이아웃 인식 파싱을 사용하여 페이지 간 정확한 리드어롱 동기화를 보장합니다.
- 광범위한 형식 지원: EPUB, PDF, TXT, MD, DOCX를 지원합니다.
- 오디오북 내보내기: 캐시된 오디오를 M4B 또는 MP3 파일로 조합할 수 있습니다.
- 자기 호스팅 유연성: Docker, S3 호환 스토리지, 여러 데이터베이스 옵션(SQLite 또는 Postgres)을 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트