hplt-project/sacremoses

Python port of Moses tokenizer, truecaser and normalizer

它解决了什么问题

Sacremoses 为自然语言处理(NLP)任务提供了一种标准化的文本预处理方式。它通过提供工具来分词、反分词、归一化和“真大小写”处理,解决了文本格式不一致的问题,确保在将数据输入机器学习模型之前保持干净和一致。

它如何工作

该库提供了 Python API 和命令行界面(CLI),用于执行多种文本处理操作:

  • 分词与反分词:将文本拆分为单个标记(单词、标点符号),并可逆向操作以重建原始句子。
  • 真大小写:一种基于训练模型将文本转换为其最可能大小写形式的过程(例如,将 "THE ADVENTURES OF SHERLOCK HOLMES" 转换为 "the adventures of Sherlock Holmes")。
  • 归一化:通过处理标点符号、移除控制字符以及归一化数字或引号来清理文本。
  • 流水线:CLI 允许用户将这些命令串联起来(例如,归一化 → 分词 → 真大小写)在单个执行流水线中完成。

适用人群

专为需要准备大型数据集以训练或评估机器翻译及其他基于文本的人工智能模型的 NLP 研究人员和开发者设计。

特色亮点

  • 全面的工具集:在一个包中包含分词、反分词、真大小写和归一化功能。
  • 支持 CLI 流水线:可通过命令行串联多个预处理步骤,实现高效的数据处理。
  • 可训练的真大小写器:支持从文本文件训练自定义的真大小写模型。
  • 多进程支持:CLI 支持 -j 标志,可利用多个 CPU 核心加速处理速度。

相关

  • 项目
  • 项目
  • 项目
  • 项目