wenet-e2e/WeTextProcessing

Text Normalization & Inverse Text Normalization

解决的问题

WeTextProcessing 提供了一个生产就绪的文本正则化(TN)和逆文本正则化(ITN)工具包。它能够将书面文本转换为口语形式(例如将 "2.5" 转换为 "two point five"),以及反向转换,这对于语音识别和文本转语音系统至关重要。

工作原理

该工具包使用有限状态转换器(FST)来处理文本。支持多种语言,包括中文和英文,并允许用户定义自定义规则以处理特定的语言模式。为优化性能,FST 图形会自动缓存,但若规则更改,也可手动重建。

适用人群

本工具专为开发语音相关 AI 应用的开发者设计,例如 ASR(自动语音识别)和 TTS(文本转语音)流水线,需要在生产环境中具备可靠、可扩展的文本处理能力。

主要亮点

  • 双向处理:支持文本正则化(TN)和逆文本正则化(ITN)。
  • 多语言支持:内置中文和英文的处理流水线。
  • 基于 FST 的架构:使用 OpenFst 和 Pynini 实现高效的基于规则的转换。
  • 生产就绪:提供 C++ 运行时用于部署,并支持处理图的自动缓存。
  • 详细映射:可获取输入与输出文本之间发生变化的文本段落和标记类型。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目