makcedward/nlpaug

Data augmentation for NLP

해결하는 문제

많은 기계학습 모델은 우수한 성능을 내기 위해 대량의 레이블 데이터가 필요하지만, 이를 수동으로 생성하는 것은 시간이 많이 소요됩니다. nlpaug는 기존의 텍스트, 오디오, 스펙트로그램 데이터를 증강함으로써 합성 훈련 데이터를 자동으로 생성하는 방법을 제공하여, 수동 작업 없이 모델 성능과 강건성을 향상시킵니다.

작동 방식

이 라이브러리는 데이터를 수정하기 위해 Augmenter 객체 시스템을 사용합니다. 세 가지 주요 모달리티를 지원합니다:

  • 텍스트: 문자(키보드 또는 OCR 오류를 시뮬레이션), 단어(동의어, 반의어 또는 BERT, RoBERTa, Word2Vec과 같은 임베딩 사용), 문장(GPT-2 또는 XLNet 사용)을 수정합니다.
  • 오디오: 피치, 속도, 볼륨 조정 및 노이즈 주입과 같은 신호 처리 기법을 적용합니다.
  • 스펙트로그램: 시간 및 주파수 마스킹과 볼륨 조정을 오디오의 시각적 표현에 적용합니다.

사용자는 Flow를 사용하여 여러 증강 함수를 순차적 또는 무작위로 적용하는 파이프라인을 만들 수 있습니다.

대상 사용자

NLP, 오디오 또는 음성 인식 프로젝트를 위한 훈련 데이터셋을 확장해야 하는 머신러닝 엔지니어 및 데이터 과학자에게 적합합니다.

주요 특징

  • 다중 모달 지원: 하나의 라이브러리에서 텍스트, 오디오, 스펙트로그램을 모두 처리합니다.
  • 통합을 위한 설계: 일반적인 신경망 프레임워크와 즉시 통합 가능합니다.
  • 풍부한 증강 방법: 단순한 무작위 교환부터 Transformer를 통한 고급 문맥 기반 단어 임베딩까지 모두 포함합니다.
  • 파이프라인 오케스트레이션: Flow 시스템을 통해 여러 증강기를 연결하여 사용할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트