CUNY-CL/wikipron
Massively multilingual pronunciation mining
解決的問題
WikiPron 設計用於自動化從 Wiktionary 收集發音資料。它解決了為多種語言手動收集字詞-發音對(G2P 資料)的問題,這對於建立語音合成或語音辨識系統至關重要。
運作方式
此工具同時作為命令列介面(CLI)與 Python API 運作。它從 Wiktionary 抓取國際音標(IPA)轉寫,允許使用者透過 ISO 639-3 碼指定語言、針對特定方言,並選擇寬式或窄式轉寫。它也處理 IPA 符號的分段,以確保變音符號與修飾符正確地與其父符號分組,進而提升機器學習建模的品質。
適用對象
此工具適合從事語音技術、語言學與自然語言處理(NLP)的研究人員與開發者,用於建立發音詞典。
主要特色
- 多語言支援:支援 348 種語言的資料挖掘。
- 可自訂抓取:可依方言與轉寫層級(寬式 vs. 狹式)進行過濾。
- IPA 分段處理:使用
segments套件正確處理 IPA 變音符號,以符合建模需求。 - 即用型資料:提供超過 500 萬個字詞-發音對的資料庫。
相關
- 專案
- 專案
- 專案
- 專案
- 專案