CUNY-CL/wikipron

Massively multilingual pronunciation mining

解决的问题

WikiPron 旨在自动化从 Wiktionary 收集发音数据。它解决了为多种语言手动收集词-发音对(G2P 数据)的问题,这对于构建语音合成或语音识别系统至关重要。

工作原理

该工具既作为命令行界面(CLI)又作为 Python API 运行。它从 Wiktionary 抓取国际音标(IPA)转写,允许用户通过 ISO 639-3 代码指定语言、针对特定方言,并选择宽式或窄式转写。它还处理 IPA 符号的分段,以确保变音符号和修饰符正确地与父符号分组,从而更好地支持机器学习建模。

适用人群

适用于从事语音技术、语言学和自然语言处理(NLP)的研究人员和开发者,用于创建发音词典。

主要亮点

  • 多语言支持:支持 348 种语言的数据挖掘。
  • 可自定义抓取:可按方言和转写级别(宽式 vs. 窄式)进行过滤。
  • IPA 分段处理:使用 segments 库正确处理 IPA 变音符号,以满足建模需求。
  • 即用型数据:提供超过 500 万个词-发音对的数据库。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目