neuphonic/neutts

On-device TTS model by Neuphonic

해결하는 문제

NeuTTS는 고품질 텍스트 음성 변환(TTS)을 클라우드 기반 API에서 로컬 기기로 이동시키기 위해 설계되었습니다. 스마트폰, 노트북, Raspberry Pi와 같은 임베디드 기기에서 지속적인 인터넷 연결 없이도 실행 가능한 가볍고 자연스러운 음성 모델 세트를 제공하여, 더 나은 개인정보 보호와 낮은 지연 시간을 보장합니다.

작동 원리

이 시스템은 텍스트 이해에 최적화된 소형 LLM 백본과 NeuCodec라고 불리는 신경망 오디오 코덱의 조합을 사용합니다. 이 아키텍처를 통해 모델은 텍스트를 처리하고 오디오 토큰을 생성하며, 코덱은 이를 가청 음성으로 변환합니다. 또한 짧은(3~15초) 오디오 샘플과 해당 텍스트를 참조로 사용하여 특정 목소리를 흉내 내는 즉각적인 보이스 클로닝을 지원합니다.

대상 사용자

임베디드 음성 에이전트, 로컬 AI 비서, 스마트 장난감 및 온디바이스 처리가 중요한 컴플라이언스 준수 애플리케이션을 만드는 개발자를 위해 구축되었습니다.

주요 특징

  • 온디바이스 최적화: 모바일 및 임베디드 하드웨어에서 효율적인 추론을 위한 GGUF 양자화를 제공합니다.
  • 즉각적인 보이스 클로닝: 단 3초의 오디오만으로 목소리를 클로닝할 수 있는 기능.
  • 다국어 지원: 영어, 스페인어, 독일어, 프랑스어 모델을 사용할 수 있습니다.
  • 감정 제어: NeuTTS-2E 모델은 고정된 화자에 대해 특정 감정 표현(예: 기쁨, 슬픔, 분노)을 허용합니다.
  • 실시간 성능: 중간 사양의 기기에서 실시간 생성이 가능합니다.
  • 내장 보안: 오용을 방지하기 위해 생성된 오디오에 지각 임계값 워터마킹이 포함되어 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트