wenet-e2e/WeTextProcessing

Text Normalization & Inverse Text Normalization

何を解決するか

WeTextProcessing は、テキスト正規化(TN)および逆テキスト正規化(ITN)のプロダクション対応ツールキットを提供します。書かれたテキストを発音形式に変換(例:"2.5" を "two point five" に変換)およびその逆を行う機能を備えており、音声認識(Speech-to-Text)および音声合成(Text-to-Speech)システムにおいて不可欠です。

動作方法

このツールキットは有限状態変換器(FST)を使用してテキストを処理します。中国語や英語を含む複数言語をサポートし、ユーザーが特定の言語パターンに対応するカスタムルールを定義できるようになっています。パフォーマンス最適化のため、FSTグラフは自動的にキャッシュされますが、ルールが変更された場合は手動で再構築可能です。

対象ユーザー

ASR(音声認識)やTTS(テキスト音声変換)パイプラインなど、音声関連のAIアプリケーションを開発する開発者向けに設計されています。プロダクション環境で信頼性とスケーラビリティを備えたテキスト処理が必要な方々に最適です。

特徴

  • 双方向処理: テキスト正規化(TN)と逆テキスト正規化(ITN)の両方をサポート。
  • 多言語対応: 中国語および英語の組み込みパイプラインを備える。
  • FSTベースアーキテクチャ: OpenFst および Pynini を使用し、効率的なルールベース変換を実現。
  • プロダクション対応: 配備用にC++ランタイムを提供し、処理グラフの自動キャッシュを実装。
  • 詳細なマッピング: 入力テキストと出力テキスト間の変更されたスパンやトークンタイプを取得可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト