PaddlePaddle/PaddleSpeech
Easy-to-use Speech Toolkit including Self-Supervised Learning model, SOTA/Streaming ASR with punctuation, Streaming TTS with text frontend, Speaker Verification System, End-to-End Speech Translation and Keyword Spotting. Won NAACL2022 Best Demo Award.
What it solves
PaddleSpeech は、重要な音声・音声タスクの実施を簡素化するために設計されたオープンソースツールキットです。開発者や研究者が、複雑なパイプラインをゼロから構築することなく、音声認識、テキスト・トゥ・スピーチ合成、およびその他の音声処理タスクを実行できる統一プラットフォームを提供します。
How it works
PaddlePaddle プラットフォーム上に構築されており、このツールキットは最先端のモデルと主要なデータセット(LibriSpeech や AIShell など)を統合しています。柔軟なアーキテクチャを提供し、訓練、推論、テスト、最終的なデプロイメントまでの一連のパイプラインをすべてサポートします。ユーザーは、コマンドラインインターフェース (CLI)、専用の Server、または本番環境向けのリアルタイムアプリケーション用の Streaming Server を介してツールキットとやり取りできます。
Who it’s for
本番環境向けの音声システムを構築する産業用アプリケーション開発者と、音声・音声技術に焦点を当てた学術研究者、その両方を対象としています。
Highlights
Comprehensive Audio Tasks: 自動音声認識 (ASR)、テキスト・トゥ・スピーチ (TTS)、話者検証、キーワード検知、音声分類、および音声翻訳をサポートします。
Production Ready: リアルタイムのユースケースに対応するため、ストリーミング ASR および TTS システムを含んでいます。
Chinese Language Optimization: テキスト正規化と Grapheme-to-Phoneme (G2P) 変換のための、ルールベースの中国語フロントエンドを備えています。
Versatile Deployment: CLI、Server、および Streaming Server のオプションを提供し、ONNX 形式と C++ 高性能デプロイメントをサポートします。
Advanced Capabilities: 標点符号の復元、ボイスクローニング、および歌唱音声合成 (SVS) を含みます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト