pnnbao97/VieNeu-TTS

Vietnamese TTS with instant voice cloning • On-device • Real-time CPU inference • 24kHz audio quality • Chuyển văn bản thành giọng nói tiếng Việt • Text to speech tiếng Việt • TTS tiếng Việt

해결하는 문제

VieNeu-TTS는 베트남어에 특화된 고음질 자연스러운 음성 합성(TTS)을 제공하며, 영어-베트남어 혼합 사용(코드 스위칭)도 지원합니다. 대규모 컴퓨팅 자원 없이도 멀티스피커 대화 및 즉시 음성 클론 기능을 수행할 수 있는 온디바이스, 저지연 음성 합성을 제공합니다.

작동 방식

이 프로젝트는 여러 모델 아키텍처(v1, v2, v3 Turbo)를 제공합니다. 최신 v3 Turbo 버전은 48kHz 고음질 오디오 출력과 전용 포네파이저를 갖춘 완전히 새로 설계된 아키텍처를 사용합니다. 다양한 백엔드를 지원: 빠른 CPU 추론과 스트리밍에 최적화된 torch 비의존 ONNX Runtime, 그리고 GPU에서 고처리량 배치 생성에 적합한 PyTorch 엔진입니다. 또한 음성 클론을 위한 참조 오디오 클립을 정리하는 노이즈 제거 파이프라인도 포함되어 있습니다.

대상 사용자

  • 개발자: 인터랙티브한 베트남어 AI 애플리케이션 또는 실시간 음성 어시스턴트를 개발하는 분들.
  • 콘텐츠 제작자: 팟캐스트나 대화 장면에 자연스러운 베트남어 내레이션을 필요로 하는 분들.
  • 엣지 디바이스 엔지니어: CPU 또는 Apple Silicon에서 효율적으로 작동하는 가벼운 오프라인 TTS 솔루션을 찾는 분들.

주요 특징

  • 이중 언어 지원: 베트남어와 영어 간 원활한 전환 가능.
  • 즉시 음성 클론: 3~8초의 오디오 클립 하나로 음성 클론 가능.
  • 고음질: v3 Turbo는 48kHz 오디오를 지원하며, 실험적인 감정 표현(예: 웃음, 한숨)도 가능.
  • 유연한 배포: Python SDK, 웹 UI, 또는 고성능 Docker 기반 API 서버로 사용 가능.
  • 최적화된 성능: 실시간 상호작용에 적합한 프레임 단위 스트리밍과 대량 합성에 적합한 배치 생성을 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트