MahmoudAshraf97/ctc-forced-aligner
Text to speech alignment using CTC forced alignment
解決的問題
本專案提供一種對音訊檔案及其對應文字轉錄進行強制對齊的方法。此過程可識別音訊錄音中特定文字段落(例如單字、字元或句子)的精確起始與結束時間戳,對於建立高品質語音語料庫至關重要。
工作原理
此工具利用 Hugging Face 提供的預訓練連接時序分類(CTC)模型,特別是 Wav2Vec2、HuBERT 和 MMS 模型。它處理音訊波形與文字轉錄,使用這些模型將發音與書面文字進行對應,並以包含精確時間戳的結構化 JSON 格式輸出結果。
適用對象
適用於從事語音轉文字資料的研究人員與開發者、語言學家,以及任何需要將音訊與文字同步用於字幕製作、語音語料庫建構或音訊分析的人。
主要特色
- 記憶體效率高:相比 TorchAudio 強制對齊 API,記憶體使用量至少減少 5 倍。
- 廣泛的語言支援:支援超過 1,100 種語言,包括英語、阿拉伯語、俄語和德語。
- 靈活的細粒度:支援句子、單字或字元級別的對齊。
- GPU 加速:支援 CUDA 以實現更快的推論速度。
- 結構化輸出:產生包含每個段落對齊文字與精確時間戳的 JSON 檔案。
相關
- 專案
- 專案
- 專案
- 專案
- 專案