CUNY-CL/wikipron
Massively multilingual pronunciation mining
解决的问题
WikiPron 旨在自动化从 Wiktionary 收集发音数据。它解决了为多种语言手动收集词-发音对(G2P 数据)的问题,这对于构建语音合成或语音识别系统至关重要。
工作原理
该工具既作为命令行界面(CLI)又作为 Python API 运行。它从 Wiktionary 抓取国际音标(IPA)转写,允许用户通过 ISO 639-3 代码指定语言、针对特定方言,并选择宽式或窄式转写。它还处理 IPA 符号的分段,以确保变音符号和修饰符正确地与父符号分组,从而更好地支持机器学习建模。
适用人群
适用于从事语音技术、语言学和自然语言处理(NLP)的研究人员和开发者,用于创建发音词典。
主要亮点
- 多语言支持:支持 348 种语言的数据挖掘。
- 可自定义抓取:可按方言和转写级别(宽式 vs. 窄式)进行过滤。
- IPA 分段处理:使用
segments库正确处理 IPA 变音符号,以满足建模需求。 - 即用型数据:提供超过 500 万个词-发音对的数据库。
相关
- 项目
- 项目
- 项目
- 项目
- 项目