lukaszliniewicz/Pandrator

Turn PDFs and EPUBs into audiobooks; subtitles or videos into dubbed videos (including translation), and more. For free. Pandrator uses local models, including voice-cloning (instant, RVC-enhanced, XTTS fine-tuning) and LLM processing. It aspires to be a user-friendly app with a GUI, an installer and all-in-one packages.

Pandrator – 로컬 우선 오디오북, 자막 & 더빙 스튜디오

소개 – Pandrator는 텍스트(책, PDF, 웹페이지 등)나 기존 미디어(비디오, 오디오 파일)를 오디오북, 자막 또는 더빙 음성으로 변환할 수 있는 데스크톱 스타일의 웹 애플리케이션입니다. 전체 워크플로우(문서 가져오기, 선택적 OCR, 텍스트 정제, 전사, AI 지원 교정/번역, 텍스트-음성 변환 생성, 검토 및 내보내기)를 단일 브라우저 UI로 통합합니다.

중요성 – 모든 무거운 음성 및 전사 모델을 로컬에서 실행할 수 있으므로, 명시적으로 클라우드 제공자를 활성화하지 않는 한 소스 문서와 생성된 오디오가 컴퓨터를 떠날 필요가 없습니다. 이는 프라이버시를 중시하는 크리에이터에게 영구적인 인터넷 연결 없이 고품질의 음성 미디어를 제작할 수 있는 방법을 제공합니다.


핵심 기능

영역 Pandrator의 기능
오디오북 제작 TXT, PDF, EPUB, DOCX, MOBI 가져오기 또는 텍스트 붙여넣기, 챕터 자동 감지, 합성을 위한 분할, 세그먼트별 음성 생성, 선택적 음성 변환(RVC) 실행, 챕터 및 표지 이미지가 포함된 WAV/MP3/Opus/FLAC/M4B로 내보내기.
자막 & 더빙 SRT(또는 WebVTT/ASS/SSA) 또는 원시 오디오/비디오 로드, 타임스탬프 및 화자 분리를 통한 전사, 자막 나란히 편집/번역, 동기화된 더빙 음성 생성, 자막만 내보내기 또는 선택 가능한 오디오/자막 트랙이 포함된 더빙 비디오로 내보내기.
음성 생성 로컬 TTS 모델(예: Kokoro, Qwen3‑TTS, XTTS‑v2, VoxCPM2, Silero 등) 또는 클라우드 서비스(OpenAI, Google Gemini, ElevenLabs, 사용자 정의 엔드포인트) 중에서 선택. 음성 복제, 다국어 음성 및 선택적 RVC 음성 간 변환을 지원합니다.
AI 지원 텍스트 작업 선택적 LLM 제공자를 자막 교정, 용어집 인식 번역, 문서 정제 및 발음 최적화에 사용할 수 있습니다. 각 AI 단계는 별도의 검토 가능한 수정본을 생성하므로 아무것도 조용히 덮어쓰지 않습니다.
발음 라이브러리 TTS 엔진으로 전송되는 페이로드에만 적용되며 표시되는 텍스트는 변경하지 않는 결정론적이고 사용자가 유지 관리하는 '찾기 및 바꾸기' 규칙.
모델 관리 Pandrator Manager는 음성/전사 구성 요소를 설치, 업데이트 및 제거합니다. 변경 전에 컴퓨팅 요구 사항, 라이선스 및 다운로드 크기를 표시합니다.
원격 / 헤드리스 사용 서비스는 기본적으로 127.0.0.1에서 수신하지만 LAN, VPN 또는 클라우드 포드 배포를 위해 역방향 프록시(HTTPS)를 통해 노출될 수 있습니다.
에이전트 통합 사이드카(pandrator‑mcp)를 통해 MCP 호환 AI 에이전트가 설치를 검사하고 워크플로우 계획을 실행하며 자격 증명 저장소 통합으로 제한된 복구 작업을 수행할 수 있습니다.

시작하기(빠른 시작)

  1. Manager 다운로드 – Windows: PandratorManager‑0.9.17‑windows‑x86_64.exe, Linux: PandratorManager‑0.9.17‑x86_64.AppImage.
  2. Manager를 실행하고 작업 공간의 상위 폴더를 선택한 다음 Pandrator를 설치하도록 합니다.
  3. Manager가 실행하는 브라우저 UI를 엽니다.
  4. Providers & services에서 필요한 로컬 모델(예: 가벼운 음성용 Kokoro, 전사용 CrispASR)을 설치합니다. 클라우드 제공자는 선택 사항입니다.
  5. 새 프로젝트를 만들고, 소스 문서 또는 미디어를 가져온 다음 단계별 패널을 따릅니다(정제 → 분할 → 생성 → 검토 → 내보내기).

기술 스택(README에 설명된 대로)

  • Python 3.11 – 핵심 백엔드, 워커 프로세스, CLI.
  • Node.js(web-build Pixi 환경을 통해 잠김) – 브라우저 UI를 빌드.
  • Pixi – Python 및 Node 종속성을 모두 처리하고 재현 가능한 환경을 제공하는 패키지 관리자.
  • AppImage / 네이티브 Windows exe – 번들된 런타임, 외부 OS 패키지 불필요.
  • 선택적 외부 도구 – URL 가져오기를 위한 yt-dlp, MOBI 변환을 위한 Calibre, credential‑stores 추가 기능을 통한 시스템 자격 증명 저장소(Windows Credential Manager, macOS Keychain, Linux Secret Service).

일반적인 사용 사례

  • 자가 출판 작가: 텍스트를 클라우드 서비스에 업로드하지 않고 원고에서 오디오북을 생성하려는 경우.
  • 교육자/팟캐스터: 강의 슬라이드나 PDF의 내레이션 버전을 제작하는 경우.
  • 비디오 크리에이터: 정확한 자막과 여러 언어의 선택적 더빙 트랙이 필요한 경우.
  • 프라이버시를 의식하는 사용자: 로컬 음성 모델(예: Whisper 기반 CrispASR, XTTS)을 선호하지만 통합 UI의 편리함을 여전히 원하는 경우.

제한 사항 및 주의점

  • 모델 크기 대 하드웨어 – 더 큰 음성 복제 모델(VoxCPM2, Fish S2 Pro)에는 CUDA 지원 GPU가 필요합니다. 더 작은 모델은 CPU에서 실행될 수 있지만 속도가 느립니다.
  • 다국어 인라인 코드 전환 – 완전히 지원되지 않습니다. 외국어 세그먼트를 수동으로 분할해야 합니다.
  • 원격 배포 – 가능하지만 수동 역방향 프록시 구성 및 비 루프백 리스너의 명시적 활성화가 필요합니다.
  • ElevenLabs 통합 – 네이티브 API 전용. API 키가 없으면 유효성 검사를 할 수 없습니다.
  • 단일 소유자 설계 – 다중 사용자 SaaS 시나리오를 위해 구축되지 않았습니다.

라이선스 및 기여

  • 핵심 Pandrator 코드는 MIT License에 따라 배포됩니다. 타사 모델 및 서비스는 자체 라이선스를 유지합니다.
  • GitHub Issues 및 풀 리퀘스트를 통한 기여를 환영합니다. 프로젝트는 실용적인 경우 테스트와 함께 집중된 변경을 요청합니다.

결론 – Pandrator는 전사, AI 지원 텍스트 처리 및 최신 TTS/음성 복제 모델을 단일하고 사용하기 쉬운 웹 인터페이스로 통합하는 진정한 오픈 소스, 로컬 실행 가능 플랫폼입니다. 별도의 도구를 조합하지 않고 프라이버시를 보호하는 오디오 제작이 필요한 크리에이터에게 적합합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트