VOICEVOX/voicevox_engine

無料で使える中品質なテキスト読み上げソフトウェア、VOICEVOXの音声合成エンジン

해결하는 문제

VOICEVOX ENGINE는 HTTP 서버를 통해 음성 합성(TTS)을 수행할 수 있는 방법을 제공합니다. 사용자와 개발자는 TTS 엔진을 자체적으로 구축하지 않고도 텍스트에서 고품질의 합성 음성을 생성하고, 발음과 억양을 조정하며, 다른 애플리케이션에 이러한 기능을 통합할 수 있습니다.

작동 방식

이 프로젝트는 음성 합성을 위한 API를 노출하는 HTTP 서버로 작동합니다. 일반적으로 두 단계로 처리됩니다. 먼저 /audio_query 요청을 보내 합성 쿼리(속도 및 억양과 같은 파라미터 포함)를 생성하고, 그 쿼리를 사용해 /synthesis 요청을 보내 최종 .wav 오디오 파일을 생성합니다. NVIDIA를 통한 GPU 가속과 CPU 가속을 모두 지원하며, Docker를 사용해 배포할 수 있습니다.

대상 사용자

  • 엔드 유저: 콘텐츠 제작을 위해 합성 음성을 생성하고 싶은 사람
  • 개발자: API를 통해 VOICEVOX 음성 합성을 자신의 소프트웨어에 통합하고 싶은 사람
  • 엔진 개발자: VOICEVOX 에디터 내에서 사용 가능한 VOICEVOX 호환 엔진을 구축하고 싶은 사람

주요 기능

  • 유연한 제어: AquesTalk 스타일의 고유한 표기법을 사용해 음성 속도, 억양, 발음을 조정할 수 있습니다.
  • 사용자 사전: 사용자 정의 단어를 추가, 편집, 삭제할 수 있는 완전한 API 지원으로 발음 정확도를 향상시킵니다.
  • 고급 합성: 두 개의 다른 목소리를 혼합하는 '보이스 모핑'과 MIDI 기반 점수를 사용하는 '노래 음성 합성' 기능을 포함합니다.
  • 개발자 친화적: Docker 이미지를 제공해 간편한 설정이 가능하며, 포괄적인 API 문서와 다중 엔진 인스턴스(Multi-Engine 기능) 지원을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트