VOICEVOX/voicevox_engine
無料で使える中品質なテキスト読み上げソフトウェア、VOICEVOXの音声合成エンジン
해결하는 문제
VOICEVOX ENGINE는 HTTP 서버를 통해 음성 합성(TTS)을 수행할 수 있는 방법을 제공합니다. 사용자와 개발자는 TTS 엔진을 자체적으로 구축하지 않고도 텍스트에서 고품질의 합성 음성을 생성하고, 발음과 억양을 조정하며, 다른 애플리케이션에 이러한 기능을 통합할 수 있습니다.
작동 방식
이 프로젝트는 음성 합성을 위한 API를 노출하는 HTTP 서버로 작동합니다. 일반적으로 두 단계로 처리됩니다. 먼저 /audio_query 요청을 보내 합성 쿼리(속도 및 억양과 같은 파라미터 포함)를 생성하고, 그 쿼리를 사용해 /synthesis 요청을 보내 최종 .wav 오디오 파일을 생성합니다. NVIDIA를 통한 GPU 가속과 CPU 가속을 모두 지원하며, Docker를 사용해 배포할 수 있습니다.
대상 사용자
- 엔드 유저: 콘텐츠 제작을 위해 합성 음성을 생성하고 싶은 사람
- 개발자: API를 통해 VOICEVOX 음성 합성을 자신의 소프트웨어에 통합하고 싶은 사람
- 엔진 개발자: VOICEVOX 에디터 내에서 사용 가능한 VOICEVOX 호환 엔진을 구축하고 싶은 사람
주요 기능
- 유연한 제어: AquesTalk 스타일의 고유한 표기법을 사용해 음성 속도, 억양, 발음을 조정할 수 있습니다.
- 사용자 사전: 사용자 정의 단어를 추가, 편집, 삭제할 수 있는 완전한 API 지원으로 발음 정확도를 향상시킵니다.
- 고급 합성: 두 개의 다른 목소리를 혼합하는 '보이스 모핑'과 MIDI 기반 점수를 사용하는 '노래 음성 합성' 기능을 포함합니다.
- 개발자 친화적: Docker 이미지를 제공해 간편한 설정이 가능하며, 포괄적인 API 문서와 다중 엔진 인스턴스(Multi-Engine 기능) 지원을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트