PaddlePaddle/PaddleSpeech

Easy-to-use Speech Toolkit including Self-Supervised Learning model, SOTA/Streaming ASR with punctuation, Streaming TTS with text frontend, Speaker Verification System, End-to-End Speech Translation and Keyword Spotting. Won NAACL2022 Best Demo Award.

What it solves

PaddleSpeech は、重要な音声・音声タスクの実施を簡素化するために設計されたオープンソースツールキットです。開発者や研究者が、複雑なパイプラインをゼロから構築することなく、音声認識、テキスト・トゥ・スピーチ合成、およびその他の音声処理タスクを実行できる統一プラットフォームを提供します。

How it works

PaddlePaddle プラットフォーム上に構築されており、このツールキットは最先端のモデルと主要なデータセット(LibriSpeech や AIShell など)を統合しています。柔軟なアーキテクチャを提供し、訓練、推論、テスト、最終的なデプロイメントまでの一連のパイプラインをすべてサポートします。ユーザーは、コマンドラインインターフェース (CLI)、専用の Server、または本番環境向けのリアルタイムアプリケーション用の Streaming Server を介してツールキットとやり取りできます。

Who it’s for

本番環境向けの音声システムを構築する産業用アプリケーション開発者と、音声・音声技術に焦点を当てた学術研究者、その両方を対象としています。

Highlights

  • Comprehensive Audio Tasks: 自動音声認識 (ASR)、テキスト・トゥ・スピーチ (TTS)、話者検証、キーワード検知、音声分類、および音声翻訳をサポートします。

  • Production Ready: リアルタイムのユースケースに対応するため、ストリーミング ASR および TTS システムを含んでいます。

  • Chinese Language Optimization: テキスト正規化と Grapheme-to-Phoneme (G2P) 変換のための、ルールベースの中国語フロントエンドを備えています。

  • Versatile Deployment: CLI、Server、および Streaming Server のオプションを提供し、ONNX 形式と C++ 高性能デプロイメントをサポートします。

  • Advanced Capabilities: 標点符号の復元、ボイスクローニング、および歌唱音声合成 (SVS) を含みます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト