MahmoudAshraf97/ctc-forced-aligner
Text to speech alignment using CTC forced alignment
解决的问题
该项目提供了一种对音频文件及其对应文本转录进行强制对齐的方法。该过程可识别音频录音中特定文本段落(如单词、字符或句子)的精确起始和结束时间戳,这对于创建高质量语音语料库至关重要。
工作原理
该工具利用 Hugging Face 提供的预训练连接时序分类(CTC)模型,特别是 Wav2Vec2、HuBERT 和 MMS 模型。它处理音频波形和文本转录,使用这些模型将语音与书面文本进行映射,并以包含精确时间戳的结构化 JSON 格式输出结果。
适用人群
适用于从事语音转文本数据的研究人员和开发者、语言学家,以及任何需要将音频与文本同步用于字幕制作、语音语料库构建或音频分析的人。
主要亮点
- 内存效率高:相比 TorchAudio 强制对齐 API,内存使用量至少减少 5 倍。
- 广泛的语言支持:支持超过 1,100 种语言,包括英语、阿拉伯语、俄语和德语。
- 灵活的粒度:支持句子、单词或字符级别的对齐。
- GPU 加速:支持 CUDA 以实现更快的推理速度。
- 结构化输出:生成包含每个段落对齐文本和精确时间戳的 JSON 文件。
相关
- 项目
- 项目
- 项目
- 项目
- 项目