PaddlePaddle/PaddleSpeech

Easy-to-use Speech Toolkit including Self-Supervised Learning model, SOTA/Streaming ASR with punctuation, Streaming TTS with text frontend, Speaker Verification System, End-to-End Speech Translation and Keyword Spotting. Won NAACL2022 Best Demo Award.

What it solves

PaddleSpeech는 중요한 음성 및 오디오 작업을 단순화하기 위해 설계된 오픈소스 툴킷입니다. 개발자와 연구자가 복잡한 파이프라인을 처음부터 구축할 필요 없이 음성 인식, 텍스트-음성 합성, 그리고 기타 오디오 처리 작업을 수행할 수 있는 통합 플랫폼을 제공합니다.

How it works

PaddlePaddle 플랫폼을 기반으로 구축된 이 툴킷은 최첨단 모델과 주요 데이터셋(LibriSpeech 및 AIShell 등)을 통합합니다. 훈련, 추론, 테스트 및 최종 배포에 이르는 전체 파이프라인을 지원하는 유연한 아키텍처를 제공합니다. 사용자는 명령줄 인터페이스(CLI), 전용 Server 또는 프로덕션급 실시간 애플리케이션을 위한 Streaming Server를 통해 툴킷과 상호작용할 수 있습니다.

Who it’s for

산업용 애플리케이션 개발자와 오디오 및 음성 기술에 집중하는 학술 연구자 모두를를 대상으로 합니다.

Highlights

  • Comprehensive Audio Tasks: 자동 음성 인식(ASR), 텍스트-음성 합성(TTS), 화자 검증, 키워드 검출, 오디오 분류 및 음성 번역을 지원합니다.
  • Production Ready: 실시간 사용 사례를 위한 스트리밍 ASR 및 TTS 시스템을 포함합니다.
  • Chinese Language Optimization: 텍스트 정규화 및 Grapheme-to-Phoneme(G2P) 변환을 위한 규칙 기반 중국어 프론트엔드를 특징으로 합니다.
  • Versatile Deployment: CLI, Server 및 Streaming Server 옵션을 제공하며, ONNX 형식 및 C++ 고성능 배포를 지원합니다.
  • Advanced Capabilities: 포함된 기능은 구두점 복원, 목소리 클로닝 및 노래 음성 합성(SVS)입니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트