lukaszliniewicz/Pandrator
Turn PDFs and EPUBs into audiobooks; subtitles or videos into dubbed videos (including translation), and more. For free. Pandrator uses local models, including voice-cloning (instant, RVC-enhanced, XTTS fine-tuning) and LLM processing. It aspires to be a user-friendly app with a GUI, an installer and all-in-one packages.
Pandrator – 로컬 우선 오디오북, 자막 & 더빙 스튜디오
소개 – Pandrator는 텍스트(책, PDF, 웹페이지 등)나 기존 미디어(비디오, 오디오 파일)를 오디오북, 자막 또는 더빙 음성으로 변환할 수 있는 데스크톱 스타일의 웹 애플리케이션입니다. 전체 워크플로우(문서 가져오기, 선택적 OCR, 텍스트 정제, 전사, AI 지원 교정/번역, 텍스트-음성 변환 생성, 검토 및 내보내기)를 단일 브라우저 UI로 통합합니다.
중요성 – 모든 무거운 음성 및 전사 모델을 로컬에서 실행할 수 있으므로, 명시적으로 클라우드 제공자를 활성화하지 않는 한 소스 문서와 생성된 오디오가 컴퓨터를 떠날 필요가 없습니다. 이는 프라이버시를 중시하는 크리에이터에게 영구적인 인터넷 연결 없이 고품질의 음성 미디어를 제작할 수 있는 방법을 제공합니다.
핵심 기능
| 영역 | Pandrator의 기능 |
|---|---|
| 오디오북 제작 | TXT, PDF, EPUB, DOCX, MOBI 가져오기 또는 텍스트 붙여넣기, 챕터 자동 감지, 합성을 위한 분할, 세그먼트별 음성 생성, 선택적 음성 변환(RVC) 실행, 챕터 및 표지 이미지가 포함된 WAV/MP3/Opus/FLAC/M4B로 내보내기. |
| 자막 & 더빙 | SRT(또는 WebVTT/ASS/SSA) 또는 원시 오디오/비디오 로드, 타임스탬프 및 화자 분리를 통한 전사, 자막 나란히 편집/번역, 동기화된 더빙 음성 생성, 자막만 내보내기 또는 선택 가능한 오디오/자막 트랙이 포함된 더빙 비디오로 내보내기. |
| 음성 생성 | 로컬 TTS 모델(예: Kokoro, Qwen3‑TTS, XTTS‑v2, VoxCPM2, Silero 등) 또는 클라우드 서비스(OpenAI, Google Gemini, ElevenLabs, 사용자 정의 엔드포인트) 중에서 선택. 음성 복제, 다국어 음성 및 선택적 RVC 음성 간 변환을 지원합니다. |
| AI 지원 텍스트 작업 | 선택적 LLM 제공자를 자막 교정, 용어집 인식 번역, 문서 정제 및 발음 최적화에 사용할 수 있습니다. 각 AI 단계는 별도의 검토 가능한 수정본을 생성하므로 아무것도 조용히 덮어쓰지 않습니다. |
| 발음 라이브러리 | TTS 엔진으로 전송되는 페이로드에만 적용되며 표시되는 텍스트는 변경하지 않는 결정론적이고 사용자가 유지 관리하는 '찾기 및 바꾸기' 규칙. |
| 모델 관리 | Pandrator Manager는 음성/전사 구성 요소를 설치, 업데이트 및 제거합니다. 변경 전에 컴퓨팅 요구 사항, 라이선스 및 다운로드 크기를 표시합니다. |
| 원격 / 헤드리스 사용 | 서비스는 기본적으로 127.0.0.1에서 수신하지만 LAN, VPN 또는 클라우드 포드 배포를 위해 역방향 프록시(HTTPS)를 통해 노출될 수 있습니다. |
| 에이전트 통합 | 사이드카(pandrator‑mcp)를 통해 MCP 호환 AI 에이전트가 설치를 검사하고 워크플로우 계획을 실행하며 자격 증명 저장소 통합으로 제한된 복구 작업을 수행할 수 있습니다. |
시작하기(빠른 시작)
- Manager 다운로드 – Windows:
PandratorManager‑0.9.17‑windows‑x86_64.exe, Linux:PandratorManager‑0.9.17‑x86_64.AppImage. - Manager를 실행하고 작업 공간의 상위 폴더를 선택한 다음 Pandrator를 설치하도록 합니다.
- Manager가 실행하는 브라우저 UI를 엽니다.
- Providers & services에서 필요한 로컬 모델(예: 가벼운 음성용 Kokoro, 전사용 CrispASR)을 설치합니다. 클라우드 제공자는 선택 사항입니다.
- 새 프로젝트를 만들고, 소스 문서 또는 미디어를 가져온 다음 단계별 패널을 따릅니다(정제 → 분할 → 생성 → 검토 → 내보내기).
기술 스택(README에 설명된 대로)
- Python 3.11 – 핵심 백엔드, 워커 프로세스, CLI.
- Node.js(
web-buildPixi 환경을 통해 잠김) – 브라우저 UI를 빌드. - Pixi – Python 및 Node 종속성을 모두 처리하고 재현 가능한 환경을 제공하는 패키지 관리자.
- AppImage / 네이티브 Windows exe – 번들된 런타임, 외부 OS 패키지 불필요.
- 선택적 외부 도구 – URL 가져오기를 위한
yt-dlp, MOBI 변환을 위한 Calibre,credential‑stores추가 기능을 통한 시스템 자격 증명 저장소(Windows Credential Manager, macOS Keychain, Linux Secret Service).
일반적인 사용 사례
- 자가 출판 작가: 텍스트를 클라우드 서비스에 업로드하지 않고 원고에서 오디오북을 생성하려는 경우.
- 교육자/팟캐스터: 강의 슬라이드나 PDF의 내레이션 버전을 제작하는 경우.
- 비디오 크리에이터: 정확한 자막과 여러 언어의 선택적 더빙 트랙이 필요한 경우.
- 프라이버시를 의식하는 사용자: 로컬 음성 모델(예: Whisper 기반 CrispASR, XTTS)을 선호하지만 통합 UI의 편리함을 여전히 원하는 경우.
제한 사항 및 주의점
- 모델 크기 대 하드웨어 – 더 큰 음성 복제 모델(VoxCPM2, Fish S2 Pro)에는 CUDA 지원 GPU가 필요합니다. 더 작은 모델은 CPU에서 실행될 수 있지만 속도가 느립니다.
- 다국어 인라인 코드 전환 – 완전히 지원되지 않습니다. 외국어 세그먼트를 수동으로 분할해야 합니다.
- 원격 배포 – 가능하지만 수동 역방향 프록시 구성 및 비 루프백 리스너의 명시적 활성화가 필요합니다.
- ElevenLabs 통합 – 네이티브 API 전용. API 키가 없으면 유효성 검사를 할 수 없습니다.
- 단일 소유자 설계 – 다중 사용자 SaaS 시나리오를 위해 구축되지 않았습니다.
라이선스 및 기여
- 핵심 Pandrator 코드는 MIT License에 따라 배포됩니다. 타사 모델 및 서비스는 자체 라이선스를 유지합니다.
- GitHub Issues 및 풀 리퀘스트를 통한 기여를 환영합니다. 프로젝트는 실용적인 경우 테스트와 함께 집중된 변경을 요청합니다.
결론 – Pandrator는 전사, AI 지원 텍스트 처리 및 최신 TTS/음성 복제 모델을 단일하고 사용하기 쉬운 웹 인터페이스로 통합하는 진정한 오픈 소스, 로컬 실행 가능 플랫폼입니다. 별도의 도구를 조합하지 않고 프라이버시를 보호하는 오디오 제작이 필요한 크리에이터에게 적합합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트