CUNY-CL/wikipron

Massively multilingual pronunciation mining

解決的問題

WikiPron 設計用於自動化從 Wiktionary 收集發音資料。它解決了為多種語言手動收集字詞-發音對(G2P 資料)的問題,這對於建立語音合成或語音辨識系統至關重要。

運作方式

此工具同時作為命令列介面(CLI)與 Python API 運作。它從 Wiktionary 抓取國際音標(IPA)轉寫,允許使用者透過 ISO 639-3 碼指定語言、針對特定方言,並選擇寬式或窄式轉寫。它也處理 IPA 符號的分段,以確保變音符號與修飾符正確地與其父符號分組,進而提升機器學習建模的品質。

適用對象

此工具適合從事語音技術、語言學與自然語言處理(NLP)的研究人員與開發者,用於建立發音詞典。

主要特色

  • 多語言支援:支援 348 種語言的資料挖掘。
  • 可自訂抓取:可依方言與轉寫層級(寬式 vs. 狹式)進行過濾。
  • IPA 分段處理:使用 segments 套件正確處理 IPA 變音符號,以符合建模需求。
  • 即用型資料:提供超過 500 萬個字詞-發音對的資料庫。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案