hplt-project/sacremoses

Python port of Moses tokenizer, truecaser and normalizer

解決的問題

Sacremoses 提供了一種標準化的方式,用於預處理自然語言處理(NLP)任務的文字。它透過提供工具來進行分詞(tokenize)、去分詞(detokenize)、正規化(normalize)和「真實大小寫還原」(truecase),解決了文字格式不一致的問題,確保在將資料輸入機器學習模型之前,資料是乾淨且一致的。

運作方式

此函式庫同時提供 Python API 和命令列介面(CLI),可執行多種文字處理操作:

  • 分詞與去分詞:將文字拆分為個別的詞元(token,如單字、標點符號),並可反轉此過程以重建原始句子。
  • 真實大小寫還原:根據訓練好的模型,將文字轉換為最可能的大小寫形式(例如,將「THE ADVENTURES OF SHERLOCK HOLMES」轉換為「the adventures of Sherlock Holmes」)。
  • 正規化:透過處理標點符號、移除控制字元,以及正規化數字或引號來清理文字。
  • 管道(Pipeline):CLI 允許使用者在單一執行管道中將這些命令串聯起來(例如,正規化 $\rightarrow$ 分詞 $\rightarrow$ 真實大小寫還原)。

適用對象

它專為需要準備大型資料集以訓練或評估機器翻譯及其他基於文字的 AI 模型的 NLP 研究人員和開發人員而設計。

重點特色

  • 全面的工具集:在單一套件中包含分詞、去分詞、真實大小寫還原和正規化功能。
  • CLI 管道支援:能夠透過命令列串聯多個預處理步驟,以進行高效的資料處理。
  • 可訓練的真實大小寫還原器:包含從文字檔案訓練自訂真實大小寫模型的功能。
  • 多處理:支援 CLI 中的 -j 旗標,可利用多個 CPU 核心來加速處理。

相關

  • 專案
  • 專案
  • 專案
  • 專案