readbeyond/aeneas

aeneas is a Python/C library and a set of tools to automagically synchronize audio and text (aka forced alignment)

解决的问题

aeneas 旨在解决「强制对齐」问题,即自动将包含片段列表的文本文件与朗读该文本的音频文件进行同步。这使得用户能够创建一个精确的时间戳地图,记录音频录音中每个文本片段的发音时间。

工作原理

该工具使用 Text-to-Speech (TTS) 引擎(如 eSpeak、AWS Polly 或 Nuance)合成文本的参考音频版本。然后通过 MFCC(梅尔频率倒谱系数)和 DTW(动态时间规整)将此合成音频与实际朗读音频进行比较,以确定每个文本片段的精确时间区间。

适用人群

主要面向研究人员、数字出版商(例如用于 EPUB 3)、以及需要在不同粒度级别(从单个单词到完整段落)对齐文本与音频的字幕创作者(SRT、VTT)。

主要亮点

  • 广泛格式支持:支持以 JSON、SRT、VTT、SMIL 和 TextGrid 等多种格式输出同步地图。
  • 多语言支持:已确认在 38 种不同语言中正常工作。
  • 灵活粒度:支持从单词级到段落级的对齐。
  • 鲁棒性:针对背景噪声、间歇性尖峰和轻微发音错误具有良好的容错能力。
  • 批量处理:可通过作业容器处理多个音频/文本对。
  • 集成性:包含多个 TTS 引擎的封装,并支持从 YouTube 下载音频。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目