MahmoudAshraf97/ctc-forced-aligner

Text to speech alignment using CTC forced alignment

何を解決するか

このプロジェクトは、音声ファイルと対応するテキストトランスクリプトの間で強制同期(forced alignment)を実行する方法を提供します。このプロセスでは、音声録音内で特定のテキストセグメント(単語、文字、文など)が発話された正確な開始時刻と終了時刻を特定します。これは、高品質な音声コーパスを作成する上で不可欠です。

動作方法

このツールは、Hugging Faceから提供される事前学習済みの接続主義時系列分類(CTC)モデル、特にWav2Vec2、HuBERT、MMSモデルを利用しています。音声波形とテキストトランスクリプトを処理し、これらのモデルを使って発話された音声を書かれたテキストにマッピングし、正確なタイムスタンプを含む構造化されたJSON形式で結果を出力します。

対象ユーザー

音声からテキストへのデータ処理に取り組む研究者や開発者、言語学者、字幕作成、音声コーパス作成、音声分析のために音声とテキストを同期させたいすべての人々に適しています。

特徴

  • メモリ効率: TorchAudioの強制同期APIと比較して、少なくとも5倍以上メモリを節約します。
  • 広範な言語対応: 英語、アラビア語、ロシア語、ドイツ語を含む1,100語以上をサポートしています。
  • 柔軟な粒度: 文、単語、文字レベルでの同期が可能です。
  • GPU加速: CUDAをサポートし、推論を高速化します。
  • 構造化出力: 各セグメントの同期されたテキストと正確なタイムスタンプを含むJSONファイルを生成します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト