makcedward/nlpaug

Data augmentation for NLP

解決的問題

許多機器學習模型需要大量標記資料才能表現良好,但手動建立這些資料耗時費力。nlpaug 透過增強現有的文字、音訊與頻譜圖資料,提供一種自動產生合成訓練資料的方法,從而無需人工介入即可提升模型性能與穩健性。

工作原理

該套件使用 Augmenter 物件系統來修改資料。支援三種主要模態:

  • 文字: 修改字元(模擬鍵盤或OCR錯誤)、單字(使用同義詞、反義詞或BERT、RoBERTa、Word2Vec等嵌入)、句子(使用GPT-2或XLNet)。
  • 音訊: 應用信號處理技術,如調整音高、速度、音量以及注入雜訊。
  • 頻譜圖: 對音訊的視覺表示應用遮罩(時間與頻率)與音量調整。

使用者可使用 Flow 建立管道,依序或隨機應用多個增強函數。

適用對象

專為需要擴展NLP、音訊或語音辨識專案訓練資料集的機器學習工程師與資料科學家設計。

主要亮點

  • 多模態支援: 一個套件即可處理文字、音訊與頻譜圖。
  • 易於整合: 與常見神經網路框架即插即用相容。
  • 豐富的增強方法: 從簡單的隨機交換到透過Transformer實現的高階語境詞嵌入應有盡有。
  • 管道編排: 透過 Flow 系統可將多個增強器串聯使用。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案