makcedward/nlpaug

Data augmentation for NLP

解决的问题

许多机器学习模型需要大量标注数据才能表现良好,但手动创建这些数据耗时费力。nlpaug 通过增强现有文本、音频和频谱图数据,提供了一种自动生成合成训练数据的方法,从而在无需人工干预的情况下提升模型性能和鲁棒性。

工作原理

该库使用 Augmenter 对象系统来修改数据。支持三种主要模态:

  • 文本: 修改字符(模拟键盘或OCR错误)、单词(使用同义词、反义词或BERT、RoBERTa、Word2Vec等嵌入)、句子(使用GPT-2或XLNet)。
  • 音频: 应用信号处理技术,如调整音高、速度、音量以及注入噪声。
  • 频谱图: 对音频的视觉表示应用掩码(时间与频率)和音量调整。

用户可以使用 Flow 创建管道,按顺序或随机应用多个增强函数。

适用人群

专为需要扩展NLP、音频或语音识别项目训练数据集的机器学习工程师和数据科学家设计。

主要亮点

  • 多模态支持: 一个库即可处理文本、音频和频谱图。
  • 易于集成: 与常见神经网络框架即插即用兼容。
  • 丰富的增强方法: 从简单的随机交换到通过Transformer实现的高级上下文词嵌入应有尽有。
  • 管道编排: 通过 Flow 系统可将多个增强器串联使用。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目