estebanstifli/LocalText2Voice
A complete local production workflow for clean narration, structured learning content, and podcast-ready audio
LocalText2Voice – 무엇인가요
LocalText2Voice 는 긴 텍스트(책, 수업 자료, 기사, 노트 등)를 음성 파일로 변환할 수 있는 무료 오픈소스 데스크톱 앱입니다. Windows 및 Linux에서 작동하며, 로컬에 설치된 음성합성(TTS) 모델을 사용해 완전히 오프라인으로 작동할 수 있으며, OpenAI, ElevenLabs, Google Gemini, Azure Speech 등의 클라우드 TTS 서비스를 선택적으로 사용할 수도 있습니다.
왜 중요한가요
- 개인정보 최우선 – 로컬 엔진을 사용하면 원본 텍스트가 컴퓨터 외부로 나가지 않습니다.
- 구독 필요 없음 – 핵심 기능은 무료로 다운로드 가능한 모델로만 작동하며, 클라우드 API는 선택 사항입니다.
- 장문 콘텐츠 전용 – 챕터, 제목, 대규모 문서를 처리하는 워크플로우로, 신뢰성 있는 생성을 위해 안전한 청크로 분할합니다.
- 품질 관리 루프 – 선택적 Faster-Whisper 단계에서 생성된 오디오를 트랜스크립트하고 원본 텍스트와 비교하여 불일치를 감지해 검토 또는 자동 재시도 대상으로 표시합니다.
- 포드캐스트 준비 출력 – 음성 녹음 후 배경 음악을 추가하고, 페이드, 덱킹, 음량 정규화를 적용한 후 단일 완성된 파일로 내보낼 수 있습니다.
핵심 워크플로우 (11단계)
- 텍스트 가져오기 – *.txt, *.md, *.docx 파일을 붙여넣기 또는 로드합니다.
- 옵션 정규화 – 언어별 사전을 적용해 발음에 적합한 텍스트로 변환합니다.
- 스마트 청크 분할 – 앱이 문서를 문단 인식형 세그먼트로 나눕니다.
- LTV 마크업 (옵션) – 소스 내에
{{voice "Emma"}},{{pause 900ms}},{{speed 0.9}}등의 명령어를 직접 삽입합니다. - TTS 생성 – 로컬 엔진(Piper, Kokoro, Chatterbox, Qwen3-TTS, OmniVoice, 옵션 F5-TTS 러시아어) 또는 클라우드 API를 선택; 엔진은 세그먼트별로 실행됩니다.
- 클린 내레이션 – 생성된 WAV 파일을 하나의 오디오 파일(M4B, MP3, M4A, Opus, FLAC, OGG)로 연결합니다.
- 옵션의 Whisper 리뷰 – Faster-Whisper가 각 세그먼트를 트랜스크립트하고 유사도/WER를 계산하며, 승인 또는 재시도 대상으로 표시합니다.
- 수동/자동 수정 – 문제 있는 세그먼트를 편집, 재생성, 또는 자르기합니다.
- 자막 내보내기 – Whisper 타임스탬프를 사용해
.srt또는 카라오케 스타일의.ass파일을 생성합니다. - 오디오 믹스 – TTS 재실행 없이 배경 음악을 추가하고, dB 단위로 볼륨 조절, 인트로/아웃트로 오프셋 설정, 덱킹 활성화, 포드캐스트 배포용 음량 정규화를 수행합니다.
- 내보내기 – 최종 오디오(옵션 자막, 프로젝트 메타데이터, 커버 아트 포함)를 디스크에 기록합니다.
주요 기능
| 기능 | 기능 설명 |
|---|---|
| 모듈식 TTS 엔진 | 다양한 로컬 모델(Piper, Kokoro, Chatterbox, Qwen3-TTS, OmniVoice, F5-TTS 러시아어)과 클라우드 API를 지원합니다. 모델은 필요 시 다운로드되며, 고립된 런타임에서 실행됩니다. |
| 보이스 라이브러리 및 클론 | 카탈로그를 탐색하고 Piper 보이스를 다운로드하거나, 짧은 참조 녹음으로 새로운 보이스를 클론(Chatterbox, OmniVoice, F5-TTS). |
| LTV 마크업 | 인라인 명령어로 보이스, 언어, 휴지 길이, 속도, 볼륨, 모델 고유 지시사항을 전환합니다. |
| 텍스트 정규화 | 언어별 사전(아랍어, 중국어, 영어, …, 러시아어)을 사용해 숫자, 날짜, 통화 등을 TTS 전에 재작성합니다. |
| Whisper 리뷰 | Faster-Whisper가 생성된 오디오를 트랜스크립트하고 원본과 비교해 유사도 점수를 계산하며, 저품질 세그먼트를 자동 재시도합니다. |
| 자막 생성 | .srt 및 단어 수준의 .ass 파일을 생성하며, 믹스에 적합한 정확한 오프셋을 적용합니다. |
| 오디오 믹스 페이지 | 배경 음악 추가, dB 단위로 볼륨 조절, 인트로/아웃트로 오프셋 설정, 덱킹 활성화, 포드캐스트 배포용 음량 정규화를 수행합니다. |
| 배치 오디오북 | 여러 책을 큐에 등록하고 개별 커버/음악을 할당해 일시정지/재개/재시도 지원으로 순차적으로 생성합니다. |
| 프로젝트 지속성 | 모든 프로젝트 데이터(메타데이터, 세그먼트 목록, 보이스 선택, Whisper 점수, 타임스탬프)는 SQLite에 저장되며, 포터블 매니페스트로 쉽게 재오픈하거나 향후 확장이 가능합니다. |
지원 플랫폼 및 요구 사항
- Windows 10/11 (64비트) – 공식 설치 프로그램 (
LocalText2Voice-Setup.exe). - Linux (64비트) – 소스에서 실행; Python 3.10+, 가상 환경,
PATH에 FFmpeg 필요. - macOS – 아직 공식 지원되지 않음.
- 하드웨어 – 4코어 CPU, 8GB RAM으로 가벼운 엔진은 작동 가능; GPU(NVIDIA CUDA)는 선택 사항이지만 Chatterbox, Qwen3-TTS, OmniVoice와 같은 대규모 모델의 처리 속도를 향상시킵니다.
라이선스 및 비용
- 애플리케이션 – MIT 라이선스, 완전 무료.
- 로컬 모델 – 실행은 무료이지만 각 모델은 자체 상류 라이선스를 따릅니다 (예: OmniVoice는 CC-BY-NC, F5-TTS 러시아어는 비영리 CC-BY-NC 4.0).
- 클라우드 API – 선택 사항; 사용은 제공자에 따라 요금 부과.
시작하기 (Windows 빠른 시작)
- 릴리스 페이지에서 최신 설치 프로그램을 다운로드합니다.
- 설치 프로그램을 실행하고 앱용 폴더와 AI 자산용 별도의
data폴더를 선택합니다. - 설정 프로필 선택 – CPU 경량 (Piper) 또는 강력한 GPU (OmniVoice + Faster-Whisper).
- 설정 → TTS 엔진에서 원하는 엔진을 설치하고 보이스를 다운로드합니다.
- 텍스트를 붙여넣기 또는 가져오고, 오디오 생성을 클릭합니다. (활성화된 경우) Whisper 결과를 검토합니다.
- 오디오 믹스 탭에서 음악을 추가하고 최종 파일을 내보냅니다.
누구에게 적합한가요?
- 저자 및 교육자 – 상용 TTS 서비스 비용 없이 오디오북이나 강의 녹음물을 자가 출판하고 싶은 사람.
- 포드캐스트 제작자 – 개인정보 보호를 유지하면서 내레이션을 생성하고 음악과 믹스하고 싶은 사람.
- 개발자 및 애호가 – 오픈소스 TTS 모델을 실험하고 커스텀 보이스 파이프라인을 구축하고 싶은 사람.
결론: LocalText2Voice 는 장문 텍스트를 고품질 음성 콘텐츠로 변환하는 완전한 오프라인 우선 파이프라인을 제공하며, 클라우드 백업, Whisper를 통한 품질 관리, 내장된 포드캐스트 믹싱 도구를 갖추고 있습니다. 모든 기능은 MIT 라이선스, 커뮤니티 주도의 코드베이스에서 구현되었습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트